中文

用于人体姿态估计的具有多尺度特征融合的全分辨率编码器-解码器网络

计算机视觉与模式识别 2021-06-02 v1

摘要

为实现更精确的2D人体姿态估计,我们以三种方式扩展成功的编码器-解码器网络simple baseline network (SBN)。为减少由大输出步长引起的量化误差,在simple baseline网络末端追加两个更多的解码器模块以获得全输出分辨率。随后,将全局上下文块(GCBs)添加到编码器和解码器模块中,以用全局上下文特征增强它们。此外,我们提出一种新颖的基于空间注意力的多尺度特征收集与分发模块(SA-MFCD)来融合与分发多尺度特征以提升姿态估计。在MS COCO数据集上的实验结果表明,我们的网络相比SBN能显著提升人体姿态估计精度,我们使用ResNet34作为骨干网络的网络甚至能达到与采用ResNet152的SBN相同的精度,且我们的网络在大型骨干网络下能取得更优结果。

关键词

引用

@article{arxiv.2106.00566,
  title  = {Full-Resolution Encoder-Decoder Networks with Multi-Scale Feature Fusion for Human Pose Estimation},
  author = {Jie Ou and Mingjian Chen and Hong Wu},
  journal= {arXiv preprint arXiv:2106.00566},
  year   = {2021}
}