从推理到运动:基于自我中心视角人机交互视频学习3D手部轨迹预测
计算机视觉与模式识别
2026-01-01 v2 人工智能
机器人学
摘要
先前关于3D手部轨迹预测的工作受限于将运动与语义监督解耦的数据集,以及弱关联推理与动作的模型。为了解决这些问题,我们首先提出了EgoMAN数据集,一个大规模的自我中心视角数据集,用于面向交互阶段感知的3D手部轨迹预测,包含219K个6自由度轨迹和300万条结构化QA对,涵盖语义、空间和运动推理。然后我们引入了EgoMAN模型,一个从推理到运动的框架,通过轨迹-标记接口将视觉语言推理与运动生成相连接。我们的方法经过渐进式训练以对齐推理与运动动态,在真实场景中产生了准确且阶段感知的轨迹,并具有泛化能力。
引用
@article{arxiv.2512.16907,
title = {Flowing from Reasoning to Motion: Learning 3D Hand Trajectory Prediction from Egocentric Human Interaction Videos},
author = {Mingfei Chen and Yifan Wang and Zhengqin Li and Homanga Bharadhwaj and Yujin Chen and Chuan Qin and Ziyi Kou and Yuan Tian and Eric Whitmire and Rajinder Sodhi and Hrvoje Benko and Eli Shlizerman and Yue Liu},
journal= {arXiv preprint arXiv:2512.16907},
year = {2026}
}
备注
Project website: https://egoman-project.github.io