中文

GIMO:情境下基于注视信息的人体运动预测

计算机视觉与模式识别 2022-07-20 v2

摘要

预测人体运动对于辅助机器人与 AR/VR 应用至关重要,其中与人的交互需安全且舒适。同时,准确的预测依赖于对场景上下文与人类意图的理解。尽管许多工作研究场景感知的人体运动预测,但由于缺乏揭示人类意图的自我中心视角以及运动与场景的有限多样性,后者在很大程度上未被充分探索。为缩小这一差距,我们提出了一个大规模人体运动数据集,其提供高质量身体姿态序列、场景扫描,以及带有作为推断人类意图替代的眼动注视的自我中心视角。通过采用惯性传感器进行动作捕捉,我们的数据收集不依赖于特定场景,这进一步提升了从受试者观察到的运动动态。我们利用多种最先进架构对借助眼动注视进行自我中心人体运动预测的优势进行了广泛研究。此外,为充分发挥注视的潜力,我们提出了一种新颖网络架构,实现注视与运动分支间的双向通信。得益于来自眼动注视的意图信息以及由运动调制的去噪注视特征,我们的网络在提出的数据集上取得了人体运动预测的顶尖性能。代码与数据可在 https://github.com/y-zheng18/GIMO 获取。

关键词

引用

@article{arxiv.2204.09443,
  title  = {GIMO: Gaze-Informed Human Motion Prediction in Context},
  author = {Yang Zheng and Yanchao Yang and Kaichun Mo and Jiaman Li and Tao Yu and Yebin Liu and C. Karen Liu and Leonidas J. Guibas},
  journal= {arXiv preprint arXiv:2204.09443},
  year   = {2022}
}