中文

扩展无语言视觉表征学习

计算机视觉与模式识别 2025-04-02 v1

摘要

视觉自监督学习 (SSL) 目前在多模态设置中(如视觉问答 VQA)的表现落后于对比语言-图像预训练 (CLIP)。这种多模态差距常被归因于语言监督带来的语义,但视觉 SSL 和 CLIP 模型通常是在不同数据上训练的。本文我们提出问题:"视觉自监督方法是否落后于 CLIP,归因于缺乏语言监督,还是训练数据的差异?"我们通过在相同的 MetaCLIP 数据上训练视觉 SSL 和 CLIP 模型,并利用 VQA 作为多样化的测试平台来研究这一问题。在这一受控设置下,视觉 SSL 模型在数据和模型容量方面优于 CLIP 模型,视觉 SSL 性能即使在扩展至 7B 参数后仍未饱和。因此,我们观察到视觉 SSL 方法在广泛的 VQA 和经典视觉基准测试中实现了与 CLIP 相当的性能。这些发现表明,纯视觉 SSL 能够在规模化后匹配语言监督的视觉预训练,为以视觉为中心的表征学习开辟了新的机遇。

关键词

引用

@article{arxiv.2504.01017,
  title  = {Scaling Language-Free Visual Representation Learning},
  author = {David Fan and Shengbang Tong and Jiachen Zhu and Koustuv Sinha and Zhuang Liu and Xinlei Chen and Michael Rabbat and Nicolas Ballas and Yann LeCun and Amir Bar and Saining Xie},
  journal= {arXiv preprint arXiv:2504.01017},
  year   = {2025}
}

备注

Project page at https://davidfan.io/webssl/