真实环境中的强化学习:LLM 部署中 RLVR 训练的特征分析
人工智能
2025-10-14 v2 分布式、并行与集群计算
机器学习
摘要
大型语言模型(LLM)现已广泛应用于多个领域。随着其快速发展,带有可验证奖励的强化学习(RLVR)在近几个月内激增,以增强其推理与理解能力。然而,其复杂的数据流和多样的任务对强化学习训练系统提出了巨大挑战,且从系统角度对 RLVR 的理解仍然有限。为了深入理解 RLVR 带来的系统挑战,我们对 LLM 部署中的 RLVR 任务进行了特征分析研究。具体而言,我们研究了不同强化学习任务在训练步骤间的工作负载分布与变化趋势。我们识别出诸如由序列长度分布倾斜导致的 GPU 空闲、动态变化工作负载中低效的并行策略、低效的数据管理机制以及负载不均衡等问题。我们描述了这些观察结果,并呼吁对剩余的开放挑战进行进一步研究。此外,我们提出了 PolyTrace 基准测试套件以在真实工作负载下进行评估,一个实际用例验证了 PolyTrace 基准测试套件具有 94.7% 的准确率。
引用
@article{arxiv.2509.25279,
title = {RL in the Wild: Characterizing RLVR Training in LLM Deployment},
author = {Jiecheng Zhou and Qinghao Hu and Yuyang Jin and Zerui Wang and Peng Sun and Yuzhe Gu and Wenwei Zhang and Mingshu Zhai and Xingcheng Zhang and Weiming Zhang},
journal= {arXiv preprint arXiv:2509.25279},
year = {2025}
}
备注
20 pages, 28 figures