隐形EgoHand:通过EgoBody姿态估计进行3D手部预测
计算机视觉与模式识别
2025-04-14 v1
摘要
从自我中心的视角预测手部运动和姿态对于理解人类意图至关重要。然而,现有方法仅关注于预测位置,而不考虑关节 articulation,且仅在手部位于摄像头视野内时才适用。这一局限忽略了即使手部位于摄像头视野之外,仍可推断出近似手部位置的事实。在本文中,我们提出了一种方法,用于从自我中心视频中预测两只手的3D轨迹和姿态,既在视野内又在视野外。我们提出了一种基于扩散的transformer架构用于自我中心手部预测,即EgoH4,该模型以观察序列和摄像机姿态为输入,然后预测两只手(摄像机佩戴者)的未来3D运动和姿态。我们利用完整身体姿态信息,使其他关节能够对手部运动提供约束。我们沿着手和身体关节进行去噪,并开发一个用于手部关节的可见性预测器以及3D到2D的重投影损失,以最小化手部位于视野内时的误差。我们在Ego-Exo4D数据集上评估EgoH4,结合了包含身体和手部标注的子集。我们在156K个序列上进行训练,在34K个序列上进行评估。EgoH4在手部轨迹预测和手部姿态预测的ADE和MPJPE方面分别优于基线高达3.4cm和5.1cm。项目页面:https://masashi-hatano.github.io/EgoH4/
引用
@article{arxiv.2504.08654,
title = {The Invisible EgoHand: 3D Hand Forecasting through EgoBody Pose Estimation},
author = {Masashi Hatano and Zhifan Zhu and Hideo Saito and Dima Damen},
journal= {arXiv preprint arXiv:2504.08654},
year = {2025}
}