中文

面向人体姿态估计的高效高分辨率视觉表征学习——基于状态空间模型

计算机视觉与模式识别 2025-08-18 v2

摘要

在捕获人体姿态估计等稠密预测任务中,同时保持高分辨率视觉表征至关重要。视觉变换器(ViT)通过自注意力机制实现了全局建模,但因其相对于标记数量的二次计算复杂度,限制了其在移动设备和资源受限环境下处理高分辨率输入的效率和可扩展性。状态空间模型(SSM),以Mamba为代表,提供了一种通过组合全局感受野和线性计算复杂度实现可扩展且资源友好序列建模的高效替代方案。然而,在应用于稠密预测任务时,现有视觉SSM面临以下关键局限:弱空间归纳偏置、隐藏状态衰减导致的长程遗忘,以及低分辨率输出限制细粒度局部化能力。为解决这些问题,我们提出一种动态视觉状态空间(DVSS)模块,通过多尺度卷积操作增强局部空间表征,强化空间归纳偏置。通过架构探索和理论分析,我们发现可变形操作是一种高效且有效的机制,用于增强语义聚合并通过输入依赖的自适应空间抽样缓解长程遗忘。我们将DVSS嵌入多分支高分辨率架构,构建HRVMamba——一种新型高效高分辨率表征学习模型。针对人体姿态估计、图像分类和语义分割进行的大量实验表明,HRVMamba在性能上与领先的CNN、ViT和SSM基线模型相称。代码已公开于https://github.com/zhanghao5201/PoseVMamba。

关键词

引用

@article{arxiv.2410.03174,
  title  = {Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation},
  author = {Hao Zhang and Yongqiang Ma and Wenqi Shao and Ping Luo and Nanning Zheng and Kaipeng Zhang},
  journal= {arXiv preprint arXiv:2410.03174},
  year   = {2025}
}