用于二维多人姿态估计的多尺度聚合 R-CNN
计算机视觉与模式识别
2019-05-13 v1
摘要
从二维图像中进行多人姿态估计具有挑战性,因为它不仅需要关键点定位,还需要人体检测。在最先进的自顶向下方法中,多尺度信息是实现准确姿态估计的关键因素,因为它同时包含关键点周围的局部信息和整个人体的全局信息。尽管多尺度信息使这些方法达到了最先进的性能,但自顶向下方法仍需要大量计算,因为它们必须使用额外的人体检测器将裁剪后的人体图像输入其姿态估计模型。为以更小计算量有效利用多尺度信息,我们提出了多尺度聚合 R-CNN(MSA R-CNN)。它由多尺度 RoIAlign 模块(MS-RoIAlign)和多尺度关键点头网络(MS-KpsNet)组成,二者旨在有效利用多尺度信息。此外,与以往自顶向下方法不同,MSA R-CNN 在单一模型中完成人体检测与关键点定位,从而减少了计算量。所提模型在基于单模型的方法中取得了最佳性能,并且在公开可用的二维多人关键点定位数据集上以更小计算量达到了与基于分离模型的方法相当的结果。
引用
@article{arxiv.1905.03912,
title = {Multi-scale Aggregation R-CNN for 2D Multi-person Pose Estimation},
author = {Gyeongsik Moon and Ju Yong Chang and Kyoung Mu Lee},
journal= {arXiv preprint arXiv:1905.03912},
year = {2019}
}
备注
Published at CVPRW 2019