对比、仿照、适应:从原始人类视频中学习机器人技能
机器人学
2024-08-13 v1
摘要
从原始人类视频中学习机器人技能仍是一个非平凡的挑战。以往的工作通过利用行为克隆或从视频中学习奖励函数来解决这个问题。尽管它们取得了显著的性能,但可能引入若干问题,例如对机器人动作的需求、人类视频和机器人视频之间一致视角和相似布局的要求,以及样本效率低的问题。为此,我们的关键洞察是通过对比视频来学习任务先验,通过仿照视频中的轨迹来学习动作先验,并利用任务先验引导轨迹适应新情景。我们提出了一个三阶段的技能学习框架,称为 Contrast-Imitate-Adapt (CIA)。提出了一种交互感知对齐变换器,用于通过对齐视频对来学习任务先验。然后使用轨迹生成模型来学习动作先验。为适应与人类视频不同的新情景,设计了 Inversion-Interaction 方法,用于初始化粗略轨迹并通过有限交互来细化。此外,CIA引入一种基于轨迹语义方向的优化方法,用于交互安全性和样本效率。由 IAAformer 计算的对齐距离用作奖励。我们在六项实际世界日常任务中评估了 CIA,实证表明 CIA 在任务成功率和对多样化新情景布局和物体实例的泛化方面显著优于以往的 state-of-the-art 作品。
引用
@article{arxiv.2408.05485,
title = {Contrast, Imitate, Adapt: Learning Robotic Skills From Raw Human Videos},
author = {Zhifeng Qian and Mingyu You and Hongjun Zhou and Xuanhui Xu and Hao Fu and Jinzhe Xue and Bin He},
journal= {arXiv preprint arXiv:2408.05485},
year = {2024}
}