中文

StableRep:来自文本到图像模型的合成图像造就强视觉表征学习器

计算机视觉与模式识别 2023-10-27 v2

摘要

我们研究了使用文本到图像模型生成的合成图像学习视觉表征的潜力。鉴于此类模型在生成高质量图像方面的优异表现,这是一个自然的问题。我们具体考虑了Stable Diffusion,领先的开源文本到图像模型之一。我们表明:(1)当生成模型配置适当的无分类器引导尺度时,在合成图像上训练自监督方法可以匹配或击败真实图像对应方法;(2)通过将同一文本提示生成的多张图像彼此视为正样本,我们开发了一种多正样本对比学习方法,称之为StableRep。仅使用合成图像,StableRep学习的表征在大规模数据集上超越了使用相同文本提示及对应真实图像由SimCLR和CLIP学习的表征性能。当我们进一步加入语言监督时,用20M合成图像训练的StableRep取得了比用50M真实图像训练的CLIP更好的准确率。

关键词

引用

@article{arxiv.2306.00984,
  title  = {StableRep: Synthetic Images from Text-to-Image Models Make Strong Visual Representation Learners},
  author = {Yonglong Tian and Lijie Fan and Phillip Isola and Huiwen Chang and Dilip Krishnan},
  journal= {arXiv preprint arXiv:2306.00984},
  year   = {2023}
}

备注

code is available at: https://github.com/google-research/syn-rep-learn