国内刊号:43-1258/TP
国际刊号:1007-130X
发布日期:
作者:孙庆骁, 刘轶, 杨海龙, 王一晴, 贾婕, 栾钟治, 钱德沛
单位:北京航空航天大学计算机学院,北京 100191
关键词:图神经网络,图形处理器,推理框架,任务调度,估计模型,
基金:科技创新2030——“新一代人工智能”重大项目(2022ZD0117805);国家自然科学基金(62072018,62322201,U22A2028);中央高校基本科研业务费专项资金(YWF-23-L-1121)
由于频繁的显存访问,图神经网络GNN在GPU上运行时往往资源利用率较低。现有的推理框架由于没有考虑GNN输入的不规则性,直接适用到GNN进行推理任务共置时可能会超出显存容量导致任务失败。对于GNN推理任务,需要根据其输入特点预先分析并发任务的显存占用情况,以确保并发任务在GPU上的成功共置。此外,多租户场景提交的推理任务亟需灵活的调度策略,以满足并发推理任务的服务质量要求。为了解决上述问题,提出了GNNSched,其在GPU上高效管理GNN推理任务的共置运行。具体来说,GNNSched将并发推理任务组织为队列,并在算子粒度上根据成本函数估算每个任务的显存占用情况。GNNSched实现了多种调度策略来生成任务组,这些任务组被迭代地提交到GPU并发执行。实验结果表明,GNNSched能够满足并发GNN推理任务的服务质量并降低推理任务的响应时延。
来源:2024年第1期
《计算机工程与科学》期刊编辑部