多实例姿态网络:重新思考自顶向下姿态估计
计算机视觉与模式识别
2021-10-29 v3
摘要
自顶向下人体姿态估计方法的一个关键假设是期望输入边界框中仅存在单个人/实例。这常导致在带有遮挡的拥挤场景中失败。我们提出一种新颖方案以克服该基本假设的局限。我们的多实例姿态网络(MIPNet)允许在给定边界框内预测多个 2D 姿态实例。我们引入多实例调制块(MIMB),可自适应调制每个实例的通道级特征响应,并且参数高效。我们在 COCO、CrowdPose 与 OCHuman 数据集上评估以证明方法有效性。具体而言,我们在 CrowdPose 上取得 70.0 AP,在 OCHuman 测试集上取得 42.5 AP,分别比先前最佳方法显著提升 2.4 AP 与 6.5 AP。当使用真值边界框进行推理时,MIPNet 在 COCO 上提升 0.7 AP、CrowdPose 上提升 0.9 AP、OCHuman 验证集上提升 9.1 AP(相较 HRNet)。有趣的是,当使用更少的高置信度边界框时,HRNet 在 OCHuman 上的性能下降(5 AP),而 MIPNet 对相同输入保持相对稳定性能(下降 1 AP)。
引用
@article{arxiv.2101.11223,
title = {Multi-Instance Pose Networks: Rethinking Top-Down Pose Estimation},
author = {Rawal Khirodkar and Visesh Chari and Amit Agrawal and Ambrish Tyagi},
journal= {arXiv preprint arXiv:2101.11223},
year = {2021}
}
备注
ICCV 2021