Social-MAE:用于多人运动表示学习的社交掩码自编码器
计算机视觉与模式识别
2024-04-09 v1
摘要
为了全面理解多人场景,必须超越检测和跟踪等基本任务。理解个体之间的交互和社交活动等更高层次的任务也至关重要。由于缺乏用于此类高级任务的充足标注数据,能够完全理解涉及多人场景的模型的进展受到了阻碍。为了应对这一挑战,我们引入了 Social-MAE,一个简单而有效的基于 Transformer 的掩码自编码器框架,用于多人人体运动数据。该框架使用掩码建模来预训练编码器以重建被掩码的人体关节轨迹,使其能够学习拥挤人群中可泛化且数据高效的运动表示。Social-MAE 包含一个作为 MAE 编码器的 Transformer 和一个更轻量的作为 MAE 解码器的 Transformer,后者在频域中对多人关节轨迹进行操作。在重建任务之后,MAE 解码器被替换为特定任务的解码器,并且针对各种高级社交任务对模型进行端到端微调。我们提出的模型结合我们的预训练方法在包括多人姿态预测、社交分组和社交动作理解在内的各种高级社交任务上取得了 SOTA 结果。这些改进在涵盖人体 2D 和 3D 身体姿态的四个流行多人数据集上得到了证明。
引用
@article{arxiv.2404.05578,
title = {Social-MAE: Social Masked Autoencoder for Multi-person Motion Representation Learning},
author = {Mahsa Ehsanpour and Ian Reid and Hamid Rezatofighi},
journal= {arXiv preprint arXiv:2404.05578},
year = {2024}
}