中文

用于密集无监督学习的密集孪生网络

计算机视觉与模式识别 2022-08-11 v2 人工智能

摘要

本文提出密集孪生网络(DenseSiam),一种用于密集预测任务的简单无监督学习框架。它通过最大化同一图像两个视图之间的相似性来学习视觉表示,采用两种一致性,即像素一致性与区域一致性。具体而言,DenseSiam首先根据重叠区域中的精确位置对应最大化像素级空间一致性。它还提取一批对应于重叠区域中若干子区域的区域嵌入(region embeddings)进行对比以实现区域一致性。与以往需要负像素对、动量编码器或启发式掩码的方法不同,DenseSiam得益于简单的孪生网络并优化不同粒度的一致性。它也证明简单的位置对应与交互式区域嵌入已足以学习相似性。我们在ImageNet上应用DenseSiam,并在各类下游任务上取得有竞争力的提升。我们还展示仅添加一些额外的任务特定损失,该简单框架即可直接进行密集预测任务。在现有的无监督语义分割基准上,它以28%的训练成本超越最优分割方法2.1 mIoU。代码与模型发布于https://github.com/ZwwWayne/DenseSiam。

关键词

引用

@article{arxiv.2203.11075,
  title  = {Dense Siamese Network for Dense Unsupervised Learning},
  author = {Wenwei Zhang and Jiangmiao Pang and Kai Chen and Chen Change Loy},
  journal= {arXiv preprint arXiv:2203.11075},
  year   = {2022}
}

备注

ECCV2022 camera ready