中文

TOPReward:基于隐藏零样本奖励的机器人奖励模型

机器人学 2026-02-24 v1 人工智能 机器学习

摘要

虽然视觉语言动作 (Vision-Language-Action, VLA) 模型在预训练方面取得了快速进展,但其在强化学习 (Reinforcement Learning, RL) 中的应用仍受限于样本效率低和稀疏奖励。开发通用且可泛化的过程奖励模型对于提供细粒度反馈至关重要,而现有时序价值函数往往难以超越其训练域。我们引入TOPReward,这是一种新型、基于概率的时序价值函数,利用预训练视频视觉语言模型 (Vision-Language Model, VLM) 的内在世界知识来估计机器人任务进度。不同于先前方法通过提示VLM直接输出进度值(易产生数值误表示),TOPReward从VLM内部的标记概率中直接提取任务进度。在130多个 distinct 实世界任务和多个机器人平台 (如Franka、YAM、SO-100/101) 的零样本评估中,TOPReward在Qwen3-VL上实现0.947的平均值排序相关性 (Value-Order Correlation, VOC),显著优于在同一开源模型上实现接近零相关性的领先基线GVL。我们进一步展示了TOPReward作为下游工具的多功能性,包括成功检测和奖励对齐行为克隆。

关键词

引用

@article{arxiv.2602.19313,
  title  = {TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics},
  author = {Shirui Chen and Cole Harrison and Ying-Chun Lee and Angela Jin Yang and Zhongzheng Ren and Lillian J. Ratliff and Jiafei Duan and Dieter Fox and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2602.19313},
  year   = {2026}
}