T-TAMER:可证明地驯服机器学习服务中的权衡
机器学习
2025-09-30 v1 计算机科学与博弈论
摘要
随着机器学习模型规模和复杂性的持续增长,高效服务面临着日益广泛的权衡,涵盖准确性、延迟、资源使用及其他目标。多模型服务进一步加剧了这些权衡;例如,在级联模型中,每个提前退出决策都需在延迟减少与潜在精度损失之间取得平衡。尽管此类权衡普遍存在且至关重要,但当前的策略在很大程度上仍是启发式的且针对特定案例,限制了其理论保证和普遍适用性。我们提出了一个通用框架 T-Tamer,将该场景形式化为一个多阶段决策过程,其目标是确定何时退出以及咨询哪个模型。我们的主要结果表明,回溯(即重新访问先前模型的能力)对于实现可证明的性能保证既是必要的也是充分的。特别地,我们证明了无回溯的策略无法获得对最优权衡的任何常数因子近似,而基于回溯的策略则可在多项式时间内可证明地达到最优权衡。我们通过在合成数据集以及视觉和自然语言处理基准测试的提前退出工作负载上的实验验证了我们的分析。结果表明,基于回溯的策略始终能产生高效的精度-延迟权衡。我们希望这项工作能为在提前退出和级联模型的设计中弥合启发式实践与理论保证提供一个原则性的基础。
引用
@article{arxiv.2509.22992,
title = {T-TAMER: Provably Taming Trade-offs in ML Serving},
author = {Yuanyuan Yang and Ruimin Zhang and Jamie Morgenstern and Haifeng Xu},
journal= {arXiv preprint arXiv:2509.22992},
year = {2025}
}
备注
Correspondence should be directed to [email protected] or [email protected]. This manuscript extends our earlier workshop version accepted at NeurIPS SPIGM 2025