中文

卷积姿态机的全局上下文

计算机视觉与模式识别 2019-06-11 v1

摘要

卷积姿态机是一种流行的用于关节姿态估计的神经网络架构。在本工作中,我们探究其经验感受野并认识到可通过整合全局上下文来增强之。为此提出 U 形上下文模块,并与语义分割领域常用的金字塔池化及空洞空间金字塔池化模块进行比较。所提神经网络在 Look Into Person 数据集上以 87.9% PCKh 达到单人姿态估计的 SOTA 精度。该网络的一个较小版本以每秒超过 160 帧运行,而精度仅低 2.9%。所提方法的泛化性在 MPII 基准上测试,显示其比基于 hourglass 的网络更快,同时提供相似精度。代码见 https://github.com/opencv/openvino_training_extensions/tree/develop/pytorch_toolkit/human_pose_estimation 。

关键词

引用

@article{arxiv.1906.04104,
  title  = {Global Context for Convolutional Pose Machines},
  author = {Daniil Osokin},
  journal= {arXiv preprint arXiv:1906.04104},
  year   = {2019}
}