多人检测、姿态估计与分割:构建良性循环
计算机视觉与模式识别
2025-08-04 v3
摘要
人体姿态估计方法在孤立人物上表现良好,但在多人聚集场景中仍感困难。以往工作通过以检测到的边界框或关键点为条件来实现姿态估计,却忽略了实例掩码。我们提出一种迭代强制边界框、实例掩码和姿态相互一致性的方法。引入的BBox-Mask-Pose(BMP)方法使用三个专门模型相互改进彼此的输出,形成一个闭环。所有模型均经过改造以实现相互条件化,从而在多人场景中提高鲁棒性。MaskPose——一种新的掩码条件姿态估计模型——在OCHuman数据集上在自上而下方法中表现最佳。BBox-Mask-Pose在OCHuman数据集上的三个任务(检测、实例分割和姿态估计)均实现了最先进水平,也在COCO姿态估计中取得了最先进成绩。该方法在实例重叠较大的场景中尤为出色,检测性能比基线检测器提高了39%。采用小型专用模型和更快的运行速度,BMP是大型人体中心基础模型的有效替代方案。代码和模型可在 https://MiraPurkrabek.github.io/BBox-Mask-Pose 获取。
引用
@article{arxiv.2412.01562,
title = {Detection, Pose Estimation and Segmentation for Multiple Bodies: Closing the Virtuous Circle},
author = {Miroslav Purkrabek and Jiri Matas},
journal= {arXiv preprint arXiv:2412.01562},
year = {2025}
}
备注
Project Website: https://mirapurkrabek.github.io/BBox-Mask-Pose