面向单目三维人体姿态估计的Mamba驱动拓扑融合
计算机视觉与模式识别
2025-09-29 v2
摘要
基于Transformer的三维人体姿态估计方法因自注意力机制复杂度随序列长度二次增长而面临显著的计算挑战。最近,Mamba模型通过利用状态空间模型(SSM)大幅降低了计算开销,并在长序列建模中展现出卓越性能。然而,SSM处理序列数据的能力并不适用于具有拓扑结构的三维关节序列,并且Mamba中的因果卷积结构也缺乏对局部关节关系的洞察。为了解决这些问题,我们在本文中提出了Mamba驱动的拓扑融合框架。具体而言,所提出的骨骼感知模块在球坐标系中推断骨骼向量的方向和长度,为Mamba模型处理关节序列提供了有效的拓扑指导。此外,我们通过整合前向和后向图卷积网络来增强Mamba模型内的卷积结构,使其能够更好地捕捉局部关节依赖关系。最后,我们设计了一个时空细化模块来对序列内的时空关系进行建模。通过融入骨骼拓扑,我们的方法有效缓解了Mamba在捕捉人体结构关系方面的局限性。我们在Human3.6M和MPI-INF-3DHP数据集上进行了广泛的测试和比较实验,结果表明所提出的方法在实现更高精度的同时,大大降低了计算成本。消融研究进一步证明了每个提出模块的有效性。代码和模型将发布。
引用
@article{arxiv.2505.20611,
title = {Mamba-Driven Topology Fusion for Monocular 3D Human Pose Estimation},
author = {Zenghao Zheng and Lianping Yang and Jinshan Pan and Hegui Zhu},
journal= {arXiv preprint arXiv:2505.20611},
year = {2025}
}