从模型学习视觉媲美从数据学习视觉
计算机视觉与模式识别
2024-01-01 v1
摘要
我们介绍了 SynCLR,这是一种仅使用合成图像和合成字幕学习视觉表示的新方法,无需任何真实数据。我们利用大语言模型(LLMs)合成了大量图像字幕数据集,然后使用现成的文本到图像模型为每个合成字幕生成多张图像。我们通过对比学习在这些合成图像上进行视觉表示学习,将共享相同字幕的图像视为正样本对。生成的表示在多种下游任务中表现良好,在图像分类任务中与 CLIP 和 DINO v2 等其他通用视觉表示学习器相比具有竞争力。此外,在密集预测任务(如语义分割)中,SynCLR 显著优于以前的自监督方法,例如在 ADE20k 数据集上使用 ViT-B/16 时,其 mIoU 比 MAE 和 iBOT 分别提高了 6.2 和 4.3。
引用
@article{arxiv.2312.17742,
title = {Learning Vision from Models Rivals Learning Vision from Data},
author = {Yonglong Tian and Lijie Fan and Kaifeng Chen and Dina Katabi and Dilip Krishnan and Phillip Isola},
journal= {arXiv preprint arXiv:2312.17742},
year = {2024}
}
备注
Code is available at https://github.com/google-research/syn-rep-learn