中文

SoMoFormer:基于Transformer的多人姿态预测

计算机视觉与模式识别 2022-08-31 v1

摘要

人体姿态预测是一个涉及复杂人体运动与姿态动力学的挑战性问题。当环境中存在多人时,一个人的运动也可能受到他人运动和动态动作的影响。尽管先前已有若干工作针对多人动态姿态预测问题,但它们通常将整个姿态序列建模为时间序列(忽略关节之间的潜在关系),或一次仅输出一个人的未来姿态序列。本文中,我们提出一种称为社交运动Transformer(Social Motion Transformer, SoMoFormer)的新方法,用于多人3D姿态预测。我们的Transformer架构独特地将人体运动输入建模为关节序列而非时间序列,使我们能够在并行预测每个关节的整个未来运动序列时,对关节进行注意力计算。我们表明,通过这一问题重构,SoMoFormer通过使用场景中所有人的关节作为输入查询,自然扩展到多人场景。利用学习到的嵌入来表示关节类型、人物身份和全局位置,我们的模型学习关节之间以及人之间的关系,对来自相同或邻近人的关节给予更强的关注。SoMoFormer在SoMoF基准以及CMU-Mocap和MuPoTS-3D数据集上的长期运动预测方面优于最先进的方法。代码将在发表后公开。

关键词

引用

@article{arxiv.2208.14023,
  title  = {SoMoFormer: Multi-Person Pose Forecasting with Transformers},
  author = {Edward Vendrow and Satyajit Kumar and Ehsan Adeli and Hamid Rezatofighi},
  journal= {arXiv preprint arXiv:2208.14023},
  year   = {2022}
}

备注

10 pages, 6 figures. Submitted to WACV 2023. Our method was submitted to the SoMoF benchmark leaderboard dated March 2022. See https://somof.stanford.edu/result/217/