中文

从视频中预训练手-物体交互

机器人学 2024-09-13 v1 人工智能 计算机视觉与模式识别

摘要

我们提出了一种从 3D 手-物体交互轨迹中学习通用机器人操作先验的方法。我们构建了一个框架,利用野外视频生成感觉运动机器人轨迹。我们通过将人手和被操作物体提升到共享的 3D 空间中,并将人类动作重定向为机器人动作来实现这一点。对这些数据进行生成建模为我们提供了一个与任务无关的基础策略。该策略捕获了通用且灵活的操作先验。我们通过实验证明,使用强化学习(RL)和行为克隆(BC)对该策略进行微调,能够实现对下游任务的样本高效适应,同时与先前的方法相比提高了鲁棒性和泛化能力。定性实验可在:\url{https://hgaurav2k.github.io/hop/} 获取。

关键词

引用

@article{arxiv.2409.08273,
  title  = {Hand-Object Interaction Pretraining from Videos},
  author = {Himanshu Gaurav Singh and Antonio Loquercio and Carmelo Sferrazza and Jane Wu and Haozhi Qi and Pieter Abbeel and Jitendra Malik},
  journal= {arXiv preprint arXiv:2409.08273},
  year   = {2024}
}