重新审视视觉语言奖励模型的学习目标
机器学习
2025-12-25 v1 人工智能
摘要
学习可泛化的奖励函数是具身智能的核心挑战。最近的工作利用对比式视觉语言模型(VLMs)获取密集、领域无关的奖励,无需人工监督。这些方法通过日益复杂的学习目标将 VLMs 适配为奖励模型,但由于训练数据、架构和评估设置的差异, meaningful comparison 仍然困难。本文通过在统一框架下评估最新基于 VLM 的奖励模型,采用相同的 backbone、fine-tuning 数据和评估环境来隔离学习目标的影响。使用 Meta-World 任务,我们通过衡量与真实奖励的一致性和与专家进展的相关性来评估建模精度。惊人地发现,简单三元组损失超越了最先进的方法,表明最近方法的许多改进可能归因于数据和架构的差异。
关键词
引用
@article{arxiv.2512.20675,
title = {Revisiting the Learning Objectives of Vision-Language Reward Models},
author = {Simon Roy and Samuel Barbeau and Giovanni Beltrame and Christian Desrosiers and Nicolas Thome},
journal= {arXiv preprint arXiv:2512.20675},
year = {2025}
}
备注
Published as an extended abstract at World Modeling Workshop 2026