ArenaRL:通过锦标赛式相对排序扩展化强化学习以适应开放性智能体
机器学习
2026-01-23 v2 人工智能
摘要
强化学习已显著提高了LLM智能体在可验证结果任务上的性能,但在解空间广阔的开放性智能体任务(如复杂旅行规划)方面仍面临挑战。由于缺乏客观真实答案,当前RL算法主要依赖于为单个响应分配标量评分的奖励模型。我们认为,这种点评分方法存在内在的判别塌陷:奖励模型难以区分不同轨迹之间的细微优势,导致同一组内的得分被压缩到狭窄范围,从而使有效奖励信号被奖励模型的噪声所主导,导致优化停滞。为此,我们提出ArenaRL,一种从点标量评分转向组内相对排序的强化学习范式。ArenaRL引入感知过程的两两评估机制,采用多层次评分标准对轨迹进行细粒度的相对评分。此外,我们构建了组内对抗性竞技场,设计锦标赛式排序方案以获得稳定的优势信号。实证结果表明,构建的有 seeding 的单 elimination 方案在几乎等同于完整两两比较的 O(N^2) 复杂度下,实现了近乎相同的数据优势估计精度,而仅以 O(N) 复杂度运行,在效率与精度之间达到了最佳平衡。此外,为弥补开放性智能体缺乏完整基准测试的不足,我们构建了 Open-Travel 和 Open-DeepResearch 两个高质量基准,涵盖 SFT、RL训练和多维评估的完整流程。大量实验表明,ArenaRL显著优于标准RL基线,使LLM智能体能够为复杂现实任务生成更稳健的解决方案。
引用
@article{arxiv.2601.06487,
title = {ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking},
author = {Qiang Zhang and Boli Chen and Fanrui Zhang and Ruixue Ding and Shihang Wang and Qiuchen Wang and Yinfeng Huang and Haonan Zhang and Rongxiang Zhu and Pengyong Wang and Ailin Ren and Xin Li and Pengjun Xie and Jiawei Liu and Ning Guo and Jingren Zhou and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2601.06487},
year = {2026}
}