在对比学习中利用第三维
计算机视觉与模式识别
2023-01-30 v1 机器学习
机器学习
摘要
自监督学习 (SSL) 方法在无标签数据上运行,以学习对下游任务有用的鲁棒表示。大多数 SSL 方法依赖于通过对 2D 图像像素图进行变换所获得的增强。这些增强忽略了生物视觉发生于沉浸式三维、时间连续的环境,且低级生物视觉严重依赖深度线索这一事实。利用由预训练的最先进单目 RGB 到深度模型(Depth Prediction Transformer,Ranftl 等人,2021)提供的信号,我们探索了将深度信号纳入 SSL 框架的两种不同方法。首先,我们评估使用 RGB+深度输入表示的对比学习。其次,我们利用深度信号从略微不同的相机位置生成新视角,从而为对比学习产生 3D 增强。我们在三个不同的 SSL 方法——BYOL、SimSiam 和 SwAV——上,使用 ImageNette(ImageNet 的 10 类子集)、ImageNet-100 和 ImageNet-1k 数据集评估这两种方法。我们发现,两种纳入深度信号的方法均提升了基线 SSL 方法的鲁棒性与泛化能力,尽管第一种方法(深度通道拼接)更优。例如,带有额外深度通道的 BYOL 在 ImageNette 上将下游分类准确率从 85.3% 提升至 88.0%,在 ImageNet-C 上从 84.1% 提升至 87.0%。
引用
@article{arxiv.2301.11790,
title = {Leveraging the Third Dimension in Contrastive Learning},
author = {Sumukh Aithal and Anirudh Goyal and Alex Lamb and Yoshua Bengio and Michael Mozer},
journal= {arXiv preprint arXiv:2301.11790},
year = {2023}
}