中文

EgoPAT3Dv2:从 2D 第一人称视觉预测 3D 动作目标以用于人机交互

机器人学 2024-03-11 v1

摘要

机器人从第一人称视频中预判手部运动的 3D 动作目标位置的能力,可以大大提高人机交互(HRI)的安全性和效率。虽然先前的研究主要集中在语义动作分类或 2D 目标区域预测上,但我们认为预测动作目标的 3D 坐标可以为更多样化的下游机器人任务铺平道路,特别是考虑到头戴式设备的日益普及。本研究扩展了 EgoPAT3D,这是唯一致力于第一人称 3D 动作目标预测的数据集。我们增加了其规模和多样性,增强了其泛化潜力。此外,通过引入大型预训练模型和人类先验知识,我们大幅提升了基线算法。值得注意的是,我们的新算法现在仅使用 RGB 图像即可实现卓越的预测结果,消除了此前对 3D 点云和 IMU 输入的需求。此外,我们将增强后的基线算法部署在现实世界的机器人平台上,以展示其在简单 HRI 任务中的实际效用。这些演示展示了我们进展的现实世界适用性,并可能激发更多涉及第一人称视觉的 HRI 用例。所有代码和数据均已开源,可在项目网站上找到。

关键词

引用

@article{arxiv.2403.05046,
  title  = {EgoPAT3Dv2: Predicting 3D Action Target from 2D Egocentric Vision for Human-Robot Interaction},
  author = {Irving Fang and Yuzhong Chen and Yifan Wang and Jianghan Zhang and Qiushi Zhang and Jiali Xu and Xibo He and Weibo Gao and Hao Su and Yiming Li and Chen Feng},
  journal= {arXiv preprint arXiv:2403.05046},
  year   = {2024}
}

备注

6 pages. Accepted at ICRA 2024