区域相似性表示学习
计算机视觉与模式识别
2021-08-20 v2
摘要
我们提出区域相似性表示学习(ReSim),一种用于基于定位的任务(如目标检测与分割)的自监督表示学习新方法。现有工作主要集中于仅学习整幅图像的全局表示,而 ReSim 同时学习用于定位的区域表示以及语义图像级表示。ReSim 通过在两视图(如图像裁剪)的重叠区域上滑动固定大小窗口,将这些区域与其对应的卷积特征图区域对齐,然后最大化跨视图的特征相似性来运作。因此,ReSim 在神经网络的卷积特征图中学习空间与语义一致的特征表示。图像区域的平移或缩放(例如物体的平移或缩放)在特征图中具有相应变化;这使得下游任务能够利用这些表示进行定位。通过目标检测、实例分割与密集姿态估计实验,我们展示了 ReSim 学习的表示相比有竞争力的 MoCo-v2 基线显著提升了定位与分类性能:VOC 上 AP,COCO 上 AP,Cityscapes 上 AP。代码与预训练模型发布于:\url{https://github.com/Tete-Xiao/ReSim}
引用
@article{arxiv.2103.12902,
title = {Region Similarity Representation Learning},
author = {Tete Xiao and Colorado J Reed and Xiaolong Wang and Kurt Keutzer and Trevor Darrell},
journal= {arXiv preprint arXiv:2103.12902},
year = {2021}
}
备注
ICCV21