面向 AI 智能体的自适应验证器多模态强化学习
人工智能
2026-04-21 v2
摘要
通过多模态强化学习(MMRL)训练的智能体推理模型已变得越来越有能力,但它们几乎普遍使用基于最终答案计算的稀疏、基于结果的奖励进行优化。从推理标记中计算的更丰富的奖励可以通过提供更细粒度的指导来显著改善学习。然而,在 MMRL 中计算信息量更大的奖励具有挑战性,因为不同样本可能需要不同的评分函数,且教师模型可能提供噪声奖励信号。在本文中,我们引入了 Argos(Agentic Reward for Grounded & Objective Scoring),一个用于训练智能体任务的 MMRL 推理模型的原理性奖励智能体。对于每个样本,Argos 从教师模型派生和基于规则的评分函数池中选择,同时评估:(i)最终响应准确性,(ii)所指实体和动作的时空定位,以及(iii)推理过程的质量。我们发现,通过在 SFT 数据策划和 RL 训练中利用我们的智能体验证器,我们的模型在多个智能体任务上取得了最先进的结果,如空间推理、视觉幻觉以及机器人和具身 AI 基准测试。关键的是,我们证明仅依赖在高度策划的推理数据上进行 SFT 后训练是不够的,因为智能体在 RL 中不可避免地会崩溃到无基础的解决方案,而没有我们的在线验证。我们还展示了我们的智能体验证器可以帮助减少 MMRL 中的奖励黑客行为。最后,我们通过 pareto-optimality 概念为 Argos 的有效性提供了理论证明。
引用
@article{arxiv.2512.03438,
title = {Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents},
author = {Reuben Tan and Baolin Peng and Zhengyuan Yang and Hao Cheng and Oier Mees and Theodore Zhao and Andrea Tupini and Isar Meijier and Qianhui Wu and Yuncong Yang and Lars Liden and Yu Gu and Sheng Zhang and Xiaodong Liu and Lijuan Wang and Marc Pollefeys and Yong Jae Lee and Jianfeng Gao},
journal= {arXiv preprint arXiv:2512.03438},
year = {2026}
}