中文

通过学习深度聚合表示实现高效人体姿态估计

计算机视觉与模式识别 2020-12-16 v2

摘要

本文中,我们提出一种通过学习深度聚合表示的高效人体姿态估计网络(DANet)。大多数现有模型主要从具有不同空间尺寸的特征中挖掘多尺度信息。强大的多尺度表示通常依赖于级联金字塔框架。该框架大幅提升了性能,但同时也使网络变得极深且复杂。相反,我们专注于从具有不同感受野尺寸的各层中提取多尺度信息,并通过改进融合方法来充分利用该信息。具体而言,我们提出正交注意力块(OAB)与二阶融合单元(SFU)。OAB 从不同层学习多尺度信息并通过鼓励其多样性来增强它们。SFU 自适应地选择并融合多样的多尺度信息,同时抑制冗余信息。这可以最大化最终融合表示中的有效信息。在 OAB 与 SFU 的辅助下,我们的单一金字塔网络能够生成包含比级联网络更丰富多尺度信息且具更大表征能力的深度聚合表示。因此,我们的网络能以小得多的模型复杂度取得可比甚至更优的精度。具体地,我们的 \mbox{DANet-72} 在 COCO test-dev 集上以仅 1.0G1.0G FLOPs 取得 70.570.5 的 AP 分数。其在 CPU 平台上的速度达到 5858 人每秒(PPS)。

关键词

引用

@article{arxiv.2012.07033,
  title  = {Efficient Human Pose Estimation by Learning Deeply Aggregated Representations},
  author = {Zhengxiong Luo and Zhicheng Wang and Yuanhao Cai and Guanan Wang and Yan Huang and Liang Wang and Erjin Zhou and Tieniu Tan and Jian Sun},
  journal= {arXiv preprint arXiv:2012.07033},
  year   = {2020}
}