EfficientPose:基于神经架构搜索的高效人体姿态估计
计算机视觉与模式识别
2020-12-15 v1
摘要
从图像与视频中进行人体姿态估计是许多多媒体应用中的一项重要任务。以往方法取得了优异性能,但很少考虑效率,这使得网络难以在资源受限设备上部署。如今实时多媒体应用需要更高效的模型以实现更好的交互。此外,大多数用于姿态估计的深度神经网络直接复用为图像分类设计的网络作为骨干,其尚未针对姿态估计任务进行优化。本文提出一个面向人体姿态估计的高效框架,包含高效骨干与高效头部两部分。通过可微神经架构搜索方法,我们为姿态估计定制骨干网络设计,并以可忽略的精度损失降低计算成本。对于高效头部,我们精简转置卷积并提出空间信息校正模块以提升最终预测性能。实验中,我们在 MPII 与 COCO 数据集上评估我们的网络。我们最小的模型仅有 0.65 GFLOPs,在 MPII 上达到 88.1% [email protected];我们的大模型仅有 2 GFLOPs,而精度与最先进大模型即具有 9.5 GFLOPs 的 HRNet 相当。
引用
@article{arxiv.2012.07086,
title = {EfficientPose: Efficient Human Pose Estimation with Neural Architecture Search},
author = {Wenqiang Zhang and Jiemin Fang and Xinggang Wang and Wenyu Liu},
journal= {arXiv preprint arXiv:2012.07086},
year = {2020}
}