中文

用于自监督视觉表示学习的孪生图像建模

计算机视觉与模式识别 2022-11-17 v3

摘要

自监督学习(SSL)已在多种下游视觉任务上展现出优越性能。已有两类主流 SSL 框架被提出,即实例判别(ID)与掩码图像建模(MIM)。ID 将同一图像不同视图的表示拉拢,同时避免特征坍缩,但其缺乏空间敏感性,而后者需要对每幅图像内的局部结构建模。另一方面,MIM 在给定掩码图像的情况下重建原始内容,但其不具备良好的语义对齐,而后者需要将语义相似视图投影至邻近表示。为化解此困境,我们观察到:(1)语义对齐可通过匹配具有强增强的不同图像视图实现;(2)空间敏感性可受益于用掩码图像预测密集表示。受这些分析驱动,我们提出孪生图像建模(SiameseIM),其基于同一图像但具不同增强的另一掩码视图,预测一个增强视图的密集表示。SiameseIM 使用具有两个分支的孪生网络。在线分支编码第一视图,并根据两视图间相对位置预测第二视图的表示。目标分支通过编码第二视图产生目标。SiameseIM 在广泛下游任务上超越 ID 与 MIM,包括 ImageNet 微调与线性探测、COCO 与 LVIS 检测,以及 ADE20k 语义分割。在少样本、长尾与关注鲁棒性的场景中提升更为显著。代码将于 https://github.com/fundamentalvision/Siamese-Image-Modeling 发布。

关键词

引用

@article{arxiv.2206.01204,
  title  = {Siamese Image Modeling for Self-Supervised Vision Representation Learning},
  author = {Chenxin Tao and Xizhou Zhu and Weijie Su and Gao Huang and Bin Li and Jie Zhou and Yu Qiao and Xiaogang Wang and Jifeng Dai},
  journal= {arXiv preprint arXiv:2206.01204},
  year   = {2022}
}