子图驻留软硬件推理协同设计
分布式、并行与集群计算
2023-07-03 v1 机器学习
摘要
越来越多的应用依赖于机器学习(ML)功能,并同时受益于更高质量的 ML 预测和更好的时效性(延迟)。计算机体系结构、ML 和系统软件文献中越来越多的研究聚焦于为 ML 模型实现更好的延迟-精度权衡。相关努力包括压缩、量化、剪枝、早退模型、混合 DNN 精度,以及最小化延迟和能耗同时保持所交付精度的 ML 推理加速器设计。然而,所有这些仅在延迟-精度权衡空间中的单一静态点带来改进。我们主张面向在动态变化部署场景中运行的应用,其中不存在单一最优静态点。我们借助最近提出的权重共享 SuperNet 机制,以服务使用(激活)该权重共享构造内不同 SubNet 的查询流。这创造了利用我们所提子图驻留(SGS)优化的机会,以发掘固有的时间局部性。我们采用软硬件协同设计方法,在 SushiAccel 中真实实现 SGS,并实现软件调度器 SushiSched 以实时控制服务哪些 SubNet 以及缓存什么。它们被垂直集成为 SUSHI——一个推理服务栈。对于查询流,SUSHI 带来高达 25% 的延迟改进、0.98% 的服务精度提升。SUSHI 可实现高达 78.7% 的片外能耗节省。
引用
@article{arxiv.2306.17266,
title = {Subgraph Stationary Hardware-Software Inference Co-Design},
author = {Payman Behnam and Jianming Tong and Alind Khare and Yangyu Chen and Yue Pan and Pranav Gadikar and Abhimanyu Rajeshkumar Bambhaniya and Tushar Krishna and Alexey Tumanov},
journal= {arXiv preprint arXiv:2306.17266},
year = {2023}
}
备注
16 pages; MLSYS 2023