AssemblyHands-X:用于理解双手人类活动的3D手-身协调建模
计算机视觉与模式识别
2025-09-30 v1
摘要
双手人类活动本质上涉及两只手和身体的协同运动。然而,由于缺乏合适的数据集,这种协调对活动理解的影响尚未得到系统评估。这种评估需要对手和身体进行基于运动学的标注(例如3D姿态),但现有的3D活动数据集通常只标注手部或身体姿态。另一类工作采用基于标记的运动捕捉来提供完整身体姿态,但物理标记会引入视觉伪影,从而限制了模型对自然无标记视频的泛化能力。为此,我们提出AssemblyHands-X,这是第一个无标记的3D手-身基准数据集,用于研究手-身协调对动作识别的影响。我们首先构建了从同步多视图视频中进行3D姿态标注的管道。我们的ethods结合了多视图三角测量与SMPL-X网格拟合,实现了对手部和上半身的可靠3D配准。随后,我们在基于图卷积或时空注意力的最新动作识别模型上验证了不同的输入表示(例如视频、手部姿态、身体姿态或手-身姿态)。我们的大量实验表明,基于姿态的动作推理比视频基线方法更高效且更准确。此外,对手和身体线索进行联合建模比仅使用手部或上半身显著改善了动作识别,凸显了建模双手-身体相互依赖动态对于全面理解双手活动的重要性。
引用
@article{arxiv.2509.23888,
title = {AssemblyHands-X: Modeling 3D Hand-Body Coordination for Understanding Bimanual Human Activities},
author = {Tatsuro Banno and Takehiko Ohkawa and Ruicong Liu and Ryosuke Furuta and Yoichi Sato},
journal= {arXiv preprint arXiv:2509.23888},
year = {2025}
}