VICtoR:学习层次化视觉-指令相关奖励以实现长时程操作
机器人学
2025-02-21 v2
摘要
我们研究了针对长时程操作任务的奖励模型,通过学习无动作视频和语言指令来实现,我们称之为视觉-指令相关 (VIC) 问题。近期的跨模态建模进展凸显了通过视觉和语言相关性进行奖励建模的潜力。然而,现有的 VIC 方法面临由于缺乏子阶段 awareness、难以建模任务复杂性以及不足的对象状态估计等挑战,导致难以为长时程任务学习奖励。为此,我们引入了 VICtoR,一种新型的层次化 VIC 奖励模型,能够为长时程操作任务提供有效的奖励信号。VICtoR 通过一种新颖的阶段检测器和运动进度评估器,在多个层次上精确评估任务进度,为有效学习任务提供有见地的指导。为验证 VICtoR 的有效性,我们在模拟和真实环境中进行了广泛实验。结果表明,VICtoR 超越了现有最佳 VIC 方法,实现了对长时程任务成功率的提升。
引用
@article{arxiv.2405.16545,
title = {VICtoR: Learning Hierarchical Vision-Instruction Correlation Rewards for Long-horizon Manipulation},
author = {Kuo-Han Hung and Pang-Chi Lo and Jia-Fong Yeh and Han-Yuan Hsu and Yi-Ting Chen and Winston H. Hsu},
journal= {arXiv preprint arXiv:2405.16545},
year = {2025}
}