对比自监督学习中变换及其组合的研究
计算机视觉与模式识别
2021-10-28 v3
摘要
在图像领域,通过噪声对比学习诱导对保持内容变换的不变性可以学习到优秀的表示。在本文中,我们将对比学习推广到更广泛的一组变换及其组合,对于它们或寻求不变性或寻求区分性。我们表明,现有方法(如SimCLR)如何扩展以做到这一点并非显而易见。相反,我们引入所有对比公式必须满足的若干形式化要求,并提出了一种满足这些要求的实用构造。为最大化该分析的影响范围,我们将噪声对比公式的所有组件表达为数据的某些广义变换(GDTs)的选择,包括数据采样。我们随后将视频作为适用大量变换的数据示例,考量额外的模态——我们分析了音频与文本——以及时间维度。我们发现,对特定变换保持不变而对其他变换保持区分性对于学习有效的视频表示至关重要,将多个基准测试的最先进水平大幅提升,甚至超越监督预训练。
引用
@article{arxiv.2003.04298,
title = {On Compositions of Transformations in Contrastive Self-Supervised Learning},
author = {Mandela Patrick and Yuki M. Asano and Polina Kuznetsova and Ruth Fong and João F. Henriques and Geoffrey Zweig and Andrea Vedaldi},
journal= {arXiv preprint arXiv:2003.04298},
year = {2021}
}
备注
Accepted to ICCV 2021. Code and pretrained models are available at https://github.com/facebookresearch/GDT