中文

面向自底向上人体姿态估计的全局关系建模与细化

计算机视觉与模式识别 2023-03-28 v1 人工智能

摘要

在本文中,我们关注多人姿态估计(MPPE)中的自底向上范式。大多数先前的自底向上方法试图在后处理过程中考虑实例之间的关系以识别不同的身体部位,而忽略了在特征学习过程中对实例或环境之间关系的建模。此外,大多数现有工作采用上采样和下采样操作。在采样过程中,会出现与源特征错位的问题,导致模型学习到的关键点特征产生偏差。为克服上述局限,我们提出了一种用于自底向上人体姿态估计的卷积神经网络。它包含两个基本模块:(i)全局关系建模(GRM)模块,在特征学习过程中通过融合多个阶段的特征,全局地学习图像区域间的关系(例如环境上下文、实例交互信息)。它结合空间-通道注意力机制,侧重于在空间与通道维度上实现自适应。(ii)多分支特征对齐(MFA)模块,聚合来自多个分支的特征以对齐融合特征并获得细化的局部关键点表示。我们的模型能够关注从局部到全局区域的不同粒度,显著提升了多人姿态估计的性能。我们在 COCO 和 CrowdPose 数据集上的结果表明,它是一个高效的多人姿态估计框架。

关键词

引用

@article{arxiv.2303.14888,
  title  = {Global Relation Modeling and Refinement for Bottom-Up Human Pose Estimation},
  author = {Ruoqi Yin and Jianqin Yin},
  journal= {arXiv preprint arXiv:2303.14888},
  year   = {2023}
}