PoseMamba:基于双向全局-局部时空状态空间模型的单目 3D 人体姿态估计
计算机视觉与模式识别
2024-12-17 v2
摘要
Transformer 在 3D 人体姿态估计 (HPE) 领域取得了显著进展。然而,现有基于 Transformer 的方法主要使用自注意力机制进行时空建模,导致二次时间复杂度、单向时空关系建模,以及不足的时空相关性学习。最近,基于状态空间模型 (SSM) 的 Mamba 架构在各种视觉任务中展现出线性复杂度下的优越长程建模能力。本文提出 PoseMamba,一种基于纯 SSM 的线性复杂度方法,用于单目视频中的 3D 人体姿态估计。具体而言,我们提出了一种双向全局-局部时空 SSM 模块,全面建模单个帧内的人体关节关系以及跨帧的时序相关性。在该双向全局-局部时空 SSM 模块中,我们引入一种重排策略以增强 SSM 的局部建模能力。该策略提供更符合逻辑的几何扫描顺序,并与全局 SSM 集成,形成结合的全局-局部空间扫描。我们使用两个基准数据集:Human3.6M 和 MPI-INF-3DHP 对方法进行了定性和定量评估。广泛实验表明,PoseMamba 在两个数据集上均实现了当前最佳性能,同时保持更小的模型规模并降低了计算成本。该代码和模型将对外发布。
引用
@article{arxiv.2408.03540,
title = {PoseMamba: Monocular 3D Human Pose Estimation with Bidirectional Global-Local Spatio-Temporal State Space Model},
author = {Yunlong Huang and Junshuo Liu and Ke Xian and Robert Caiming Qiu},
journal= {arXiv preprint arXiv:2408.03540},
year = {2024}
}
备注
Accpeted by the 39th Annual AAAI Conference on Artificial Intelligence (AAAI 2025)