中文

对比多视图编码

计算机视觉与模式识别 2020-12-21 v5 机器学习

摘要

人类通过多种感官通道观察世界,例如左眼观察的长波光通道,或右耳听到的高频振动通道。每个视图都是含噪且不完整的,但重要因素(如物理、几何和语义)往往在所有视图间共享(例如,“狗”可以被看到、听到和感觉到)。我们研究了一个经典假设:强大的表示能够建模视图不变因素。我们在多视图对比学习的框架下研究这一假设,在该框架中,我们学习一种旨在最大化同一场景不同视图间互信息且除此之外保持紧凑的表示。我们的方法可扩展至任意数量的视图,并且是视图无关的。我们分析了使该方法有效的关键特性,发现对比损失优于基于跨视图预测的流行替代方案,并且我们学习的视图越多,所得表示捕捉底层场景语义的效果越好。我们的方法在图像和视频无监督学习基准上取得了 SOTA 结果。代码发布于:http://github.com/HobbitLong/CMC/。

关键词

引用

@article{arxiv.1906.05849,
  title  = {Contrastive Multiview Coding},
  author = {Yonglong Tian and Dilip Krishnan and Phillip Isola},
  journal= {arXiv preprint arXiv:1906.05849},
  year   = {2020}
}

备注

Code: http://github.com/HobbitLong/CMC/