中文

MDPose:基于混合密度模型的实时多人姿态估计

计算机视觉与模式识别 2023-05-09 v2

摘要

多人姿态估计的主要挑战之一是实例感知的关键点估计。先前的方法通过借助现成检测器、启发式后分组过程或显式实例识别过程来解决该问题,阻碍了推理速度的进一步提升,而推理速度是实际应用中的重要因素。从统计角度看,那些用于识别实例的额外过程对于规避学习人体关键点的高维联合分布是必要的,而该分布是另一主要挑战——遮挡场景——的关键因素。本工作中,我们提出一种通过混合密度模型对人体关键点联合分布建模的单阶段实例感知姿态估计新框架,称为 MDPose。我们的 MDPose 使用由一个仅含 8 个卷积层的实例感知关键点头构成的混合密度模型来估计人体关键点坐标的分布,通过最小化真实关键点的负对数似然进行训练。此外,我们提出一种简单而有效的训练策略——随机关键点分组(RKG),其显著缓解了下溢问题,从而成功学习关键点间的关系。在由高度遮挡人物图像组成的 OCHuman 数据集上,我们的 MDPose 通过成功学习人体关键点的高维联合分布取得了最先进(SOTA)性能。此外,得益于所提出的更简单的单阶段流程,我们的 MDPose 在广泛使用的关键点数据集 MS COCO 上以具竞争力的精度显著提升了推理速度。

关键词

引用

@article{arxiv.2302.08751,
  title  = {MDPose: Real-Time Multi-Person Pose Estimation via Mixture Density Model},
  author = {Seunghyeon Seo and Jaeyoung Yoo and Jihye Hwang and Nojun Kwak},
  journal= {arXiv preprint arXiv:2302.08751},
  year   = {2023}
}

备注

UAI 2023