数据监督还是语言监督:是什么让 CLIP 优于 DINO?
计算机视觉与模式识别
2025-10-15 v1 人工智能
计算与语言
机器学习
多媒体
摘要
作为视觉-语言模型(VLM)的视觉编码器,CLIP 优于 DINO 等自监督模型,但这一优势究竟源于 CLIP 的语言监督,还是其规模大得多的训练数据,目前尚不清楚。为厘清这两个因素,我们在受控条件下——使用相同的架构、数据集与训练配置——对 CLIP 与 DINO 进行预训练,使二者达到相近的 ImageNet 准确率。嵌入分析表明,CLIP 捕获高层语义(如物体类别、文本),而 DINO 对颜色、风格等底层特征更为敏感。在集成进 VLM 并于 20 个 VQA 基准上评估时,CLIP 在文本密集型任务上表现优异,而 DINO 在视觉中心型任务上略胜一筹。语言监督的若干变体(如 sigmoid 损失、预训练语言编码器)带来的增益有限。我们的发现为视觉编码器设计及其对 VLM 性能的影响提供了科学洞见。
引用
@article{arxiv.2510.11835,
title = {Data or Language Supervision: What Makes CLIP Better than DINO?},
author = {Yiming Liu and Yuhui Zhang and Dhruba Ghosh and Ludwig Schmidt and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2510.11835},
year = {2025}
}
备注
EMNLP 2025 Findings