面向高性能单阶段人体姿态估计
计算机视觉与模式识别
2023-01-13 v1
摘要
使自顶向下人体姿态估计方法同时具备良好性能与高效率颇具吸引力。Mask RCNN可通过在单一框架内执行行人检测与姿态估计来大幅提升效率,因为骨干网络提供的特征能够被两个任务共享。然而,其性能不如传统的两阶段方法。本文中,我们旨在大幅推进Mask-RCNN的人体姿态估计结果,同时保持效率。具体而言,我们对姿态估计的整个过程进行改进,包含特征提取与关键点检测。特征提取部分确保获取足够且有价值的姿态信息。随后,我们在关键点检测分支中引入全局上下文模块以扩大感受野,因为这对于成功的人体姿态估计至关重要。在COCO val2017集上,我们使用ResNet-50骨干的模型达到68.1的AP,比Mask RCNN(AP为65.5)高2.6。相较于经典两阶段自顶向下方法SimpleBaseline,我们的模型大幅缩小了性能差距(68.1 AP对68.9 AP),且推理速度更快(77 ms对168 ms),证明了所提方法的有效性。代码见:https://github.com/lingl_space/maskrcnn_keypoint_refined。
引用
@article{arxiv.2301.04842,
title = {Towards High Performance One-Stage Human Pose Estimation},
author = {Ling Li and Lin Zhao and Linhao Xu and Jie Xu},
journal= {arXiv preprint arXiv:2301.04842},
year = {2023}
}
备注
5 pages, 5 figures, accepted at ACM Multimedia Asia (MMAsia) 2022