国内刊号:43-1258/TP
国际刊号:1007-130X
发布日期:
作者:罗婧, 叶志晟, 杨泽华, 傅天豪, 魏雄, 汪小林, 罗英伟,
单位:1.武汉纺织大学计算机与人工智能学院,湖北 武汉 430200;2.鹏城实验室,广东 深圳 518000;3.北京大学计算机学院,北京 100871)
关键词:GPU集群,深度学习,集群负载,任务数据集,资源利用率,
基金:国家自然科学基金(62032001,62032008)
近年来,随着深度学习模型训练需求增长,研究机构和企业通过搭建共享GPU集群来降低成本和提高效率。现有研究主要关注企业生产类GPU集群的任务调度和资源分配。针对研发类GPU集群鹏城云脑I,进行任务运行时关键指标的监控和数据采集,构建含任务细粒度时序资源使用信息的深度学习训练任务数据集——鹏城云脑I任务数据集。该数据集是首个面向研发类GPU集群公开数据集,揭示了研发类GPU集群中资源利用率低的现象,为研发类GPU集群高资源利用率的调度器设计提供依据和参考,推动任务调度和资源分配机制的研究。
来源:2024年第12期
《计算机工程与科学》期刊编辑部