MAMMA:无标记与自动多人运动动作捕捉
计算机视觉与模式识别
2026-04-08 v4
摘要
我们提出了 MAMMA,一个无标记动作捕捉流水线,能够从两人交互序列的多视角视频中准确恢复 SMPL-X 参数。传统动作捕捉系统依赖物理标记。尽管它们提供高精度,但对专用硬件、手动标记放置和大量后处理的需求使其成本高昂且耗时。近期基于学习的方法试图克服这些限制,但大多数是为单人捕捉设计的,依赖稀疏关键点,或在遮挡和物理交互方面存在困难。在本工作中,我们提出了一种方法,在分割掩码的条件下预测密集的、接触感知的 2D 表面关键点,即使在严重遮挡下也能实现特定于人的对应估计。我们采用了一种新颖的架构,利用每个关键点的可学习查询。我们证明我们的方法可以处理复杂的人-人交互,并且比现有方法提供更高的精度。为了训练我们的网络,我们构建了一个大型合成多视角数据集,结合了来自多种来源的人体运动,包括极端姿态、手部动作和近距离交互。我们的数据集生成了具有丰富身体接触和遮挡的高变异性合成序列,并包含带有密集 2D 关键点的 SMPL-X 真值标注。其结果是一个无需标记即可捕捉人体运动的系统。我们的方法在重建质量上与商业基于标记的动作捕捉解决方案具有竞争力,且无需大量手动清理。最后,我们通过引入两个基于真实多视角序列的评估设置,解决了密集关键点预测和无标记动作捕捉缺乏通用基准的问题。我们的数据集可在 https://mamma.is.tue.mpg.de 获取,供研究使用。
引用
@article{arxiv.2506.13040,
title = {MAMMA: Markerless & Automatic Multi-Person Motion Action Capture},
author = {Hanz Cuevas-Velasquez and Anastasios Yiannakidis and Soyong Shin and Giorgio Becherini and Markus Höschle and Joachim Tesch and Taylor Obersat and Tsvetelina Alexiadis and Eni Halilaj and Michael J. Black},
journal= {arXiv preprint arXiv:2506.13040},
year = {2026}
}
备注
Main paper and supplementary material