用于人体姿态估计的多上下文注意力机制
计算机视觉与模式识别
2017-02-27 v1
摘要
在本文中,我们提出将卷积神经网络与多上下文注意力机制相结合,构建一个用于人体姿态估计的端到端框架。我们采用堆叠沙漏网络,从具有不同语义的多种分辨率特征中生成注意力图。利用条件随机场(CRF)对注意力图中相邻区域之间的相关性进行建模。我们进一步结合了关注全身全局一致性的整体注意力模型,以及关注不同身体部位详细描述的身体部位注意力模型。因此,我们的模型能够关注从局部显著区域到全局语义一致空间的不同粒度。此外,我们设计了新颖的沙漏残差单元以增大网络的感受野。这些单元是残差单元的扩展,通过一个包含更大感受野滤波器的旁支,使得不同尺度的特征在沙漏残差单元内被学习并组合。所提出的的多上下文注意力机制和沙漏残差单元的有效性在两个广泛使用的人体姿态估计基准上进行了评估。我们的方法在两个基准的所有身体部位上均优于所有现有方法。
引用
@article{arxiv.1702.07432,
title = {Multi-Context Attention for Human Pose Estimation},
author = {Xiao Chu and Wei Yang and Wanli Ouyang and Cheng Ma and Alan L. Yuille and Xiaogang Wang},
journal= {arXiv preprint arXiv:1702.07432},
year = {2017}
}
备注
The first two authors contribute equally to this work