中文

RLVMR: 基于可验证元推理奖励的强化学习用于鲁棒长期程度代理人

机器学习 2025-07-31 v1 人工智能

摘要

为复杂长期任务开发自主代理人是AI的核心目标之一。然而,主导性训练方法面临一个关键局限性:仅针对最终任务成功进行优化的强化学习方法往往会强化错误或不高效的推理路径,我们称之为低效探索。这导致代理人脆弱且难以泛化,因为它们学习找到解决方案的能力,而非学习如何进行连贯的推理。为此,我们引入RLVMR,一种新型框架,将稠密的、过程级监督整合到端到端强化学习中,通过奖励可验证的、元推理行为来实现。RLVMR使代理人能够显式标记其认知步骤,如规划、探索和反思,并为有助于有效问题解决的行为提供程序化、基于规则的奖励。这些以过程为中心的奖励与最终结果信号相结合,并使用无评论的策略梯度方法进行优化。在ALFWorld和ScienceWorld等具有挑战性的基准测试中,RLVMR实现了新的状态突破,其中我们的7B模型在最难的未见任务 split上达到了83.6%的成功率。我们的分析确认,这些收益源于推理质量的提升,包括显著减少冗余动作和增强错误恢复,从而导致更鲁棒、更高效且更可解释的代理人。

关键词

引用

@article{arxiv.2507.22844,
  title  = {RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents},
  author = {Zijing Zhang and Ziyang Chen and Mingxiao Li and Zhaopeng Tu and Xiaolong Li},
  journal= {arXiv preprint arXiv:2507.22844},
  year   = {2025}
}