国内刊号:43-1258/TP
国际刊号:1007-130X
发布日期:
作者:温鑫, 曾焘, 李春波, 徐子晨
单位:南昌大学数学与计算机学院,江西 南昌 330031
关键词:模型推理服务,服务器无感计算,机器学习,
基金:国家重点研发计划(2022YFB4501703);江西省科技厅重点研发计划(20212BBE53004);南昌大学江西省财政科技专项(ZBG20230418043);江西省研究生创新基金(YC2023-B010)
模型推理服务正随着大模型技术的发展被广泛应用,为模型推理服务构建稳定可靠的体系结构支撑逐渐成为云服务商关注的焦点。服务器无感计算是一种资源粒度细、抽象程度高的云服务计算范式,具有按需计费、弹性扩展等优势,能够有效提高模型推理服务的计算效率。但是,模型推理服务工作流呈现出多阶段的特点,独立的服务器无感计算框架难以确保模型推理服务工作流各阶段的最优执行。因此,如何利用不同服务器无感计算框架的性能特征,实现模型推理服务工作流各阶段的在线切换,缩短整体工作流的执行时间,是亟待解决的关键问题。讨论模型推理服务在不同服务器无感计算框架上的切换问题。首先,使用预训练模型构建模型推理服务函数,得出异构服务器无感计算框架的性能特征;其次,采用机器学习技术构建二分类模型,结合异构服务器无感计算框架的性能特征,实现模型推理服务在线切换框架原型;最后,搭建测试平台,生成模型推理服务工作流,完成在线切换框架原型的性能评估。初步实验结果表明,在线切换框架原型与独立的服务器无感计算框架相比,最大可缩短模型推理服务工作流57%的执行时间。
来源:2024年第7期
《计算机工程与科学》期刊编辑部