提升虚拟智能体学习与推理:一种步级、多维通用奖励模型与基准测试
计算机视觉与模式识别
2025-06-24 v2
摘要
通用虚拟智能体的发展在自主任务执行中展现出巨大潜力。然而,当前的训练范式面临关键限制,包括依赖结果监督和耗费大量人力的人工标注。为应对这些挑战,我们提出了 Similar,一种步级多维通用奖励模型,它为智能体训练提供细粒度信号,并能为推理时扩展选择更好的动作。具体而言,我们首先系统定义了评估智能体动作的五个维度。在此框架基础上,我们设计了 MCTS-P 算法,以自动收集和标注步级、五维的智能体执行数据。利用这些数据,我们采用 Triple-M 策略训练 Similar。此外,我们引入了虚拟智能体领域首个用于步级多维奖励模型训练和评估的基准测试,命名为 SRM。该基准测试由两部分组成:SRMTrain,用作 Similar 的训练集;SRMEval,用于评估奖励模型的人工挑选测试集。实验结果表明,Similar 通过其步级多维评估和协同增益,在训练和推理时扩展期间均为 GVA 提供了有效的中间信号。项目地址:https://github.com/antgroup/Similar。
引用
@article{arxiv.2503.18665,
title = {Boosting Virtual Agent Learning and Reasoning: A Step-Wise, Multi-Dimensional, and Generalist Reward Model with Benchmark},
author = {Bingchen Miao and Yang Wu and Minghe Gao and Qifan Yu and Wendong Bu and Wenqiao Zhang and Yunfei Li and Siliang Tang and Tat-Seng Chua and Juncheng Li},
journal= {arXiv preprint arXiv:2503.18665},
year = {2025}
}
备注
Home page is available at https://dcd-ant-similar.github.io