HigherHRNet:用于自底向上人体姿态估计的尺度感知表征学习
计算机视觉与模式识别
2020-03-13 v3 机器学习
图像与视频处理
摘要
自底向上的人体姿态估计方法由于尺度变化的挑战,在预测小尺寸人物的正确姿态时存在困难。在本文中,我们提出 HigherHRNet:一种新颖的自底向上人体姿态估计方法,利用高分辨率特征金字塔学习尺度感知表征。配备用于训练的多分辨率监督和用于推理的多分辨率聚合,所提出的方法能够解决自底向上多人姿态估计中的尺度变化挑战,并更精确地定位关键点,尤其是对于小尺寸人物。HigherHRNet 中的特征金字塔由来自 HRNet 的特征图输出和通过转置卷积上采样的更高分辨率输出组成。HigherHRNet 在 COCO test-dev 上以 2.5% AP 优于先前最佳的自底向上方法(针对中等尺寸人物),显示了其在处理尺度变化方面的有效性。此外,HigherHRNet 在 COCO test-dev 上取得了新的最先进结果(70.5% AP),且未使用细化或其他后处理技术,超越了所有现有的自底向上方法。HigherHRNet 甚至在 CrowdPose test(67.6% AP)上超越所有自顶向下方法,表明其在拥挤场景中的鲁棒性。代码和模型可在 https://github.com/HRNet/Higher-HRNet-Human-Pose-Estimation 获取。
引用
@article{arxiv.1908.10357,
title = {HigherHRNet: Scale-Aware Representation Learning for Bottom-Up Human Pose Estimation},
author = {Bowen Cheng and Bin Xiao and Jingdong Wang and Honghui Shi and Thomas S. Huang and Lei Zhang},
journal= {arXiv preprint arXiv:1908.10357},
year = {2020}
}
备注
CVPR 2020