HybridServe:基于置信度级联路由的大型AI模型高效服务
机器学习
2025-05-20 v1
摘要
巨型深度神经网络(DNN)已成为准确且稳健支持大规模云端AI服务不可可少的工具。然而,由于巨型DNN模型分区和副本所需的庞大GPU集群,能源消耗观点下,服务巨型DNN的成本难以承受,甚至容易超过训练成本。现有方法要么优化能源效率,要么优化推理准确度,二者难兼顾。为克服这一现状,我们提出HybridServe——一种新的混合式DNN模型服务系统,利用多个规模版本(从小型到巨型)的模型联合服务。通过基于置信度的混合模型服务数据流,HybridServe倾向于在不影响准确度的前提下,使用更节能的较小模型来服务推理请求,从而减少巨型DNN所需的副本数量。HybridServe还 features一种数据流规划器,用于高效划分和复制候选模型,以最大化服务系统吞吐量。针对HybridServe的原型实现进行实验结果表明,其能源消耗降低最高可达当前最先进的DNN模型服务系统的19.8倍,同时保持与仅使用巨型DNN服务完全相同的准确度。
引用
@article{arxiv.2505.12566,
title = {HybridServe: Efficient Serving of Large AI Models with Confidence-Based Cascade Routing},
author = {Leyang Xue and Yao Fu and Luo Mai and Mahesh K. Marina},
journal= {arXiv preprint arXiv:2505.12566},
year = {2025}
}