基于情境强化学习的成本效益高的多阶段 ML 流水线自动扩展框架
机器学习
2026-02-02 v1 分布式、并行与集群计算
摘要
多阶段 ML 推理管道由于异构资源、跨阶段耦合以及动态瓶颈迁移,难以自动扩展。我们提出了 SAIR,一种利用 LLM 作为情境强化学习控制器的自动扩展框架,通过奖励标记的交互历史在线改进其策略,无需梯度更新。SAIR 结合了帕累托支配奖励塑形与可证明分离间隙、基于惊讶的经验检索以提高情境效率,以及通过用户空间 CUDA 拦截实现的细粒度 GPU 速率控制。我们提供了误差分解分析,将其分解为检索覆盖和 LLM 选择两个组成部分。在四条 ML 服务管道下的三种工作负载模式下,SAIR 在部署的基准方法中实现了最佳或持平的最高 P99 延迟和有效资源成本,提升了 P99 延迟最高可达 50%,有效成本降低最高可达 97%(在 GPU 速率控制假设下),瓶颈检测准确率达 86%,且无需离线训练。
引用
@article{arxiv.2601.22397,
title = {SAIR: Cost-Efficient Multi-Stage ML Pipeline Autoscaling via In-Context Reinforcement Learning},
author = {Jianchang Su and Yifan Zhang and Shengkai Lin and Shizhen Zhao and Yusheng Zheng and Yiwei Yang and Wei Zhang},
journal= {arXiv preprint arXiv:2601.22397},
year = {2026}
}