重新思考人群中的姿态估计:克服检测信息瓶颈与歧义性
计算机视觉与模式识别
2023-10-10 v2 定量方法
摘要
个体间的频繁交互是姿态估计算法面临的根本挑战。当前流程或使用目标检测器加姿态估计器(自顶向下方法),或先定位所有身体部位再将其连接以预测个体姿态(自底向上)。然而,当个体紧密交互时,自顶向下方法因个体重叠而定义不清,自底向上方法常错误推断与远处身体部位的连接。因此,我们提出一种称为自底向上条件自顶向下姿态估计(BUCTD)的新流程,结合自底向上与自顶向下方法的优势。具体而言,我们提议使用自底向上模型作为检测器,其除估计边界框外还提供姿态提议,作为条件输入基于注意力的自顶向下模型。我们在动物与人姿态估计基准上展示了方法的性能与效率。在 CrowdPose 与 OCHuman 上,我们以显著优势超越先前最先进模型。我们在 CrowdPose 上达到 78.5 AP,在 OCHuman 上达到 48.5 AP,分别比先前最佳提升 8.6% 与 7.8%。此外,我们表明该方法显著提升了涉及鱼与猴的多动物基准性能。代码见 https://github.com/amathislab/BUCTD
引用
@article{arxiv.2306.07879,
title = {Rethinking pose estimation in crowds: overcoming the detection information-bottleneck and ambiguity},
author = {Mu Zhou and Lucas Stoffl and Mackenzie Weygandt Mathis and Alexander Mathis},
journal= {arXiv preprint arXiv:2306.07879},
year = {2023}
}
备注
Published at ICCV 2023; Code at https://github.com/amathislab/BUCTD Video at https://www.youtube.com/watch?v=BHZnA-CZeZY