中文

HumMUSS:基于状态空间模型的人体运动理解

计算机视觉与模式识别 2024-04-18 v1 人工智能

摘要

从视频中理解人体运动是诸多应用的核心任务,包括姿态估计、网格恢复和动作识别。虽然最新方法主要依赖基于Transformer的架构,但这些方法在实际场景中存在局限性。Transformer在对连续帧序列进行实时顺序预测时速度较慢,且难以适应新的帧率。鉴于这些限制,我们提出了一种基于最新进展中的状态空间模型构建的、无注意力机制的时空人体运动理解模型。我们的模型不仅在各种运动理解任务中匹配基于Transformer的模型性能,还带来了诸多额外好处,例如适应不同视频帧率、在较长的关键点序列上实现更快的训练速度。此外,所提模型支持离线和实时应用。对于实时顺序预测, our model 在保持高精度的同时,内存效率更高,速度比基于Transformer的方法快数倍。

关键词

引用

@article{arxiv.2404.10880,
  title  = {HumMUSS: Human Motion Understanding using State Space Models},
  author = {Arnab Kumar Mondal and Stefano Alletto and Denis Tome},
  journal= {arXiv preprint arXiv:2404.10880},
  year   = {2024}
}

备注

CVPR 24