基于 VLMs 的训练-free temporally 一致奖励生成
机器人学
2025-07-08 v1
摘要
近期视觉语言模型(VLMs)的进展显著提升了在具身任务中的性能,如目标分解和视觉理解。然而,由于预训练数据集中缺乏领域特定的机器人知识,且计算成本高昂,限制了其在实际应用中的实时性,为机器人操作提供准确奖励仍具有挑战性。为此,我们提出了 -VLM,一个 novel 的训练-free、temporally 一致的框架,通过跟踪 VLM 派生子目标状态的变化来生成准确奖励。具体而言,我们首先在每次交互前查询 VLM 以建立具有空间感知能力的子目标并估计初始完成情况。随后,我们采用贝叶斯跟踪算法动态更新目标完成状态,并利用子目标隐藏状态为强化学习(RL)智能体生成结构化奖励。该方法增强了长期决策能力,改善了故障恢复性能。大量实验表明,-VLM 在两个机器人操作基准测试中实现了最先进的性能,展现了在降低计算消耗的同时获得更高奖励准确性的优势。我们认为该方法不仅推动了奖励生成技术的发展,也为具身 AI 领域的整体进步贡献了力量。项目网站: https://t2-vlm.github.io/。
引用
@article{arxiv.2507.04789,
title = {Training-free Generation of Temporally Consistent Rewards from VLMs},
author = {Yinuo Zhao and Jiale Yuan and Zhiyuan Xu and Xiaoshuai Hao and Xinyi Zhang and Kun Wu and Zhengping Che and Chi Harold Liu and Jian Tang},
journal= {arXiv preprint arXiv:2507.04789},
year = {2025}
}