中文

面向多模态三维手部轨迹预测的新型扩散模型

计算机视觉与模式识别 2025-11-17 v2

摘要

预测手部运动对于理解人类意图以及弥合人类运动与机器人操作之间的动作空间至关重要。现有的手部轨迹预测(HTP)方法根据过去的自我中心观测来预测未来手部在三维空间中的路径点。然而,此类模型仅设计用于处理二维自我中心视频输入。缺乏对来自二维和三维观测的多模态环境信息的感知,阻碍了三维HTP性能的进一步提升。此外,这些模型忽略了手部运动与头戴式相机自我运动之间的协同作用,要么孤立地预测手部轨迹,要么仅从过去帧中编码自我运动。为了解决这些局限性,我们提出了面向多模态三维手部轨迹预测的新型扩散模型(MMTwin)。MMTwin旨在吸收多模态信息作为输入,包括二维RGB图像、三维点云、过去手部路径点和文本提示。此外,两个潜在扩散模型——自我运动扩散和HTP扩散作为孪生模型——被集成到MMTwin中,以同时预测相机自我运动和未来手部轨迹。我们提出了一种新颖的混合Mamba-Transformer模块作为HTP扩散的去噪模型,以更好地融合多模态特征。在三个公开数据集和我们自记录数据上的实验结果表明,与最先进的基线相比,我们提出的MMTwin能够预测合理的未来三维手部轨迹,并且能够很好地泛化到未见过的环境。代码和预训练模型已在https://github.com/IRMVLab/MMTwin发布。

关键词

引用

@article{arxiv.2504.07375,
  title  = {Novel Diffusion Models for Multimodal 3D Hand Trajectory Prediction},
  author = {Junyi Ma and Wentao Bao and Jingyi Xu and Guanzhong Sun and Xieyuanli Chen and Hesheng Wang},
  journal= {arXiv preprint arXiv:2504.07375},
  year   = {2025}
}

备注

Accepted to IROS 2025