从视频中预训练手-物体交互
机器人学
2024-09-13 v1 人工智能
计算机视觉与模式识别
摘要
我们提出了一种从 3D 手-物体交互轨迹中学习通用机器人操作先验的方法。我们构建了一个框架,利用野外视频生成感觉运动机器人轨迹。我们通过将人手和被操作物体提升到共享的 3D 空间中,并将人类动作重定向为机器人动作来实现这一点。对这些数据进行生成建模为我们提供了一个与任务无关的基础策略。该策略捕获了通用且灵活的操作先验。我们通过实验证明,使用强化学习(RL)和行为克隆(BC)对该策略进行微调,能够实现对下游任务的样本高效适应,同时与先前的方法相比提高了鲁棒性和泛化能力。定性实验可在:\url{https://hgaurav2k.github.io/hop/} 获取。
引用
@article{arxiv.2409.08273,
title = {Hand-Object Interaction Pretraining from Videos},
author = {Himanshu Gaurav Singh and Antonio Loquercio and Carmelo Sferrazza and Jane Wu and Haozhi Qi and Pieter Abbeel and Jitendra Malik},
journal= {arXiv preprint arXiv:2409.08273},
year = {2024}
}