中文

M3Act:从合成人类群体活动中学习

计算机视觉与模式识别 2024-05-06 v6 人工智能 机器学习

摘要

复杂人类交互与群体活动的研究已成为以人为中心的计算机视觉中的焦点。然而,相关任务的进展常受限于从真实场景获取大规模标注数据集的困难。为应对这一局限,我们提出 M3Act,一个用于多视角多群体多人原子动作与群体活动的合成数据生成器。基于 Unity 引擎,M3Act 具备多个语义群体、高度多样且逼真的图像,以及一套全面的标注,从而有助于在单人、多人与多群体条件下学习以人为中心的任务。我们通过三个核心实验展示了 M3Act 的优势。结果表明,我们的合成数据集能显著提升若干下游方法的性能,并可替代真实世界数据集以降低成本。值得注意的是,M3Act 在 DanceTrack 数据集上改进了当前最优的 MOTRv2,使其在排行榜上从第 10 名跃升至第 2 名。此外,M3Act 为可控 3D 群体活动生成开辟了新研究。我们定义了多种指标,并为这一新任务提出了一个有竞争力的基线。我们的代码与数据发布于项目页:http://cjerry1243.github.io/M3Act。

关键词

引用

@article{arxiv.2306.16772,
  title  = {M3Act: Learning from Synthetic Human Group Activities},
  author = {Che-Jui Chang and Danrui Li and Deep Patel and Parth Goel and Honglu Zhou and Seonghyeon Moon and Samuel S. Sohn and Sejong Yoon and Vladimir Pavlovic and Mubbasir Kapadia},
  journal= {arXiv preprint arXiv:2306.16772},
  year   = {2024}
}