中文

LGM-Pose:用于实时人体姿态估计的轻量级全局建模网络

计算机视觉与模式识别 2025-11-14 v2

摘要

当前大多数顶级顶部-下多人姿态估计轻量级方法基于多分支平行纯 CNN 网络结构,往往难以捕获用于检测语义复杂关键点的全局上下文,同时因其复杂冗余结构导致延迟高。为此,本文提出一种近似单分支轻量级全局建模网络(LGM-Pose),以解决上述挑战。网络中设计了轻量级 MobileViM 模块,并提出了 Lightweight Attentional Representation Module(LARM),通过 Non-Parametric Transformation Operation(NPT-Op)整合 patch 内部及跨 patch 间的信息,以提取全局信息。此外,引入新型 Shuffle-Integrated Fusion Module(SFusion),有效整合多尺度信息,缓解单分支结构常見的性能退化。在 COCO 和 MPII 数据集上的实验评估表明,我们的方法不仅在参数数量上优于现有主流轻量级方法,还实现了卓越的性能与更快的处理速度。

关键词

引用

@article{arxiv.2506.04561,
  title  = {LGM-Pose: A Lightweight Global Modeling Network for Real-time Human Pose Estimation},
  author = {Biao Guo and Cong Zhou and Fangmin Guo and Xiaonan Luo and Guibo Luo and Feng Zhang},
  journal= {arXiv preprint arXiv:2506.04561},
  year   = {2025}
}