中文

DexVIP:从视频中利用人手姿态先验学习灵巧抓取

机器人学 2022-02-02 v1 计算机视觉与模式识别

摘要

灵巧多指机械手具有庞大的动作空间,但其与人类手的形态相似性蕴含着加速机器人学习的巨大潜力。我们提出 DexVIP,一种从野外 YouTube 视频中人类-物体交互学习灵巧机械抓取的方法。具体而言,我们从人类-物体交互视频中筛选抓取图像,并在利用深度强化学习学习抓取时,对智能体手部位姿施加先验。我们方法的一个关键优势是所学策略能够利用自由形式的野外视觉数据。因此,它可轻松扩展到新物体,并规避了在实验室中收集人类演示这一标准做法——一种更昂贵且间接的人类专长获取方式。通过在 27 个物体上使用 30 自由度仿真机械手实验,我们证明 DexVIP 优于缺乏手部位姿先验或依赖专用遥操作设备获取人类演示的现有方法,且训练更快。项目主页:https://vision.cs.utexas.edu/projects/dexvip-dexterous-grasp-pose-prior

关键词

引用

@article{arxiv.2202.00164,
  title  = {DexVIP: Learning Dexterous Grasping with Human Hand Pose Priors from Video},
  author = {Priyanka Mandikal and Kristen Grauman},
  journal= {arXiv preprint arXiv:2202.00164},
  year   = {2022}
}