中文

利用视觉运动预测建模人类偏好以提升从自我中心人类视频中学习机器人技能

机器人学 2026-02-13 v1

摘要

我们提出了一种通过将人类偏好建模为奖励函数并优化机器人行为以最大化该奖励,从而从自我中心人类视频中学习机器人技能的方法。先前从视频中学习奖励的工作试图将视觉状态的长期价值量化为其与演示视频中终止状态之间的时间距离。这些方法做出的假设限制了从视频中学习时的性能。它们还必须跨具身和环境差异迁移学习到的价值函数。我们的方法通过学习预测后续图像之间跟踪点的运动来建模人类偏好,并将奖励函数定义为机器人行为中每一步预测与观测到的物体运动之间的一致性。然后,我们使用一个经过10次机器人上演示初始化的改进型软演员-评论家(SAC)算法,从该奖励中估计价值函数,并优化一个最大化该价值函数的策略,所有操作均在机器人上完成。我们的方法能够在真实机器人上学习,并且我们表明,使用我们的奖励模型学习到的策略在模拟和真实机器人上的多个任务中均匹配或超越了先前的工作。

关键词

引用

@article{arxiv.2602.11393,
  title  = {Human Preference Modeling Using Visual Motion Prediction Improves Robot Skill Learning from Egocentric Human Video},
  author = {Mrinal Verghese and Christopher G. Atkeson},
  journal= {arXiv preprint arXiv:2602.11393},
  year   = {2026}
}

备注

15 pages, 11 figures