中文

EMO-X:一种高效的多人姿态与形状估计一阶段模型

计算机视觉与模式识别 2025-12-01 v2

摘要

表达的人类姿态与形状估计(EHPS)旨在从单目图像中联合估计人类姿态、手部姿势和面部表情。现有方法主要依赖基于Transformer的架构,由于自注意力机制的二次复杂度,在多人场景中导致计算开销巨大,尤其是近年来,Mamba因其高效的全局建模能力而成为Transformer的有前景的替代方案。然而,Mamba在捕捉细粒度的局部依赖方面仍受限,这些依赖对于精确的EHPS至关重要。为解决这些问题,我们提出了EMO-X,即用于多人EHPS的高效多人一阶段模型。具体而言,我们探索了一种基于扫描的全局-局部解码器(SGLD),将全局上下文与骨架感知的局部特征相结合,以迭代方式增强人类标记。我们的EMO-X利用Mamba的优势全局建模能力,并设计了一种用于骨架感知局部细化的局部双向扫描机制。综合实验表明,EMO-X在效率与准确性之间取得了极佳的平衡。显著的是,它相较于最先进(SOTA)方法,计算复杂度显著降低,推理时间减少了69.8%,同时在大多数方面都优于它们。

关键词

引用

@article{arxiv.2504.08718,
  title  = {EMO-X: Efficient Multi-Person Pose and Shape Estimation in One-Stage},
  author = {Haohang Jian and Jinlu Zhang and Junyi Wu and Zhigang Tu},
  journal= {arXiv preprint arXiv:2504.08718},
  year   = {2025}
}

备注

The manuscript is being revised to include new experimental results and an improved model architecture