用于像素与区域标注的高分辨率表示
计算机视觉与模式识别
2019-04-10 v1
摘要
高分辨率表示学习在许多视觉问题中起着至关重要的作用,例如姿态估计与语义分割。为高分辨率人体姿态估计而近期提出的高分辨率网络(HRNet)\cite{SunXLW19},通过并行连接高到低分辨率卷积,并在整个过程中保持高分辨率表示,且通过跨并行卷积的反复融合产生强的高分辨率表示。本文中,我们通过引入一个简单而有效的改动,对高分辨率表示进行进一步研究,并将其应用于广泛的视觉任务。我们通过聚合来自所有并行卷积的(上采样的)表示,而非如 \cite{SunXLW19} 中仅来自高分辨率卷积的表示,来增强高分辨率表示。这一简单改动带来了更强的表示,其优越性由更优结果所证实。我们在 Cityscapes、LIP 和 PASCAL Context 的语义分割,以及 AFLW、COFW、W 和 WFLW 的人脸关键点检测上展示了顶尖结果。此外,我们从高分辨率表示构建多级表示,并将其应用于 Faster R-CNN 目标检测框架及扩展框架。所提方法在 COCO 目标检测上取得了优于现有单模型网络的结果。代码与模型已公开于 \url{https://github.com/HRNet}。
引用
@article{arxiv.1904.04514,
title = {High-Resolution Representations for Labeling Pixels and Regions},
author = {Ke Sun and Yang Zhao and Borui Jiang and Tianheng Cheng and Bin Xiao and Dong Liu and Yadong Mu and Xinggang Wang and Wenyu Liu and Jingdong Wang},
journal= {arXiv preprint arXiv:1904.04514},
year = {2019}
}