中文

一幅 caption 抵得过千张图像吗?一项关于表征学习的受控研究

计算机视觉与模式识别 2022-07-18 v1 机器学习 机器学习

摘要

CLIP [Radford et al., 2021] 的发展引发了一场争论:语言监督能否产生比传统仅图像方法具有更强可迁移表征的视觉模型。我们的工作通过对两种方法的仔细受控比较来研究这一问题,比较依据为它们学习可泛化至下游分类任务的表征的能力。我们发现,当预训练数据集满足某些标准——即其规模足够大且包含变异性低的描绘性 caption——时,即便使用更多图像数据训练,仅图像方法也无法匹敌 CLIP 的迁移性能。然而,与人们的预期相反,存在一些不满足这些标准的实际场景,其中通过 caption 增加的监督实际上是有害的。受我们的发现启发,我们设计了简单的方案,使 CLIP 能更好地利用现有预训练数据集中存在的语言信息。

关键词

引用

@article{arxiv.2207.07635,
  title  = {Is a Caption Worth a Thousand Images? A Controlled Study for Representation Learning},
  author = {Shibani Santurkar and Yann Dubois and Rohan Taori and Percy Liang and Tatsunori Hashimoto},
  journal= {arXiv preprint arXiv:2207.07635},
  year   = {2022}
}