中文

数据决定对比语言图像预训练(CLIP)的分布鲁棒性

计算机视觉与模式识别 2022-08-24 v2 计算与语言 机器学习

摘要

诸如 CLIP、ALIGN 和 BASIC 等对比训练的语言-图像模型已展现出对多种具有挑战性的自然分布偏移前所未有的鲁棒性。由于这些语言-图像模型在若干方面不同于以往的训练方法,一个重要的问题在于是什么导致了巨大的鲁棒性提升。我们通过系统的实验研究回答了这一问题。具体而言,我们研究了鲁棒性提升的五种可能原因:(i)训练集规模,(ii)训练分布,(iii)训练时的语言监督,(iv)测试时的语言监督,以及(v)对比损失函数。我们的实验表明,更具多样性的训练分布是鲁棒性提升的主要原因,其他因素几乎未贡献鲁棒性。除实验结果外,我们还引入了 ImageNet-Captions,一个带有来自 Flickr 的原始文本标注的 ImageNet 版本,以支持进一步的语言-图像训练受控实验。

关键词

引用

@article{arxiv.2205.01397,
  title  = {Data Determines Distributional Robustness in Contrastive Language Image Pre-training (CLIP)},
  author = {Alex Fang and Gabriel Ilharco and Mitchell Wortsman and Yuhao Wan and Vaishaal Shankar and Achal Dave and Ludwig Schmidt},
  journal= {arXiv preprint arXiv:2205.01397},
  year   = {2022}
}