中文

TULIP:通用语言-图像预训练之路

计算机视觉与模式识别 2025-04-09 v2 人工智能 计算与语言 机器学习

摘要

尽管最近的图像-文本对比模型(如 CLIP 和 SigLIP)取得了显著成功,但这些模型在需要高保真图像理解的任务上常常表现不佳,例如计数、深度估计和细粒度目标识别。这些模型通过进行语言对齐,倾向于优先考虑高层语义而非视觉理解,从而削弱了图像理解能力。另一方面,面向视觉的模型在处理视觉信息方面表现出色,但在理解语言方面困难,限制了其在语言驱动任务中的灵活性。本文介绍 TULIP,一个开源的、可直接替换现有 CLIP 类模型的方案。我们的方法利用生成式数据增强、增强的图像-图像和文本-文本对比学习,以及图像/文本重建正则化,旨在学习细粒度视觉特征,同时保持全局语义对齐。我们的方案规模可达数十亿参数,在多个基准测试中超越了现有的 SOTA 模型, 在 ImageNet-1K 上实现了新的 SOTA 零样例性能,对 RxRx1 线性探针中的 few-shot 分类提升了最高达 2×2\times,在 MMVP 上超越 SigLIP 的得分提升了超过 3×3\times。我们的代码/模型可在 https://tulip-berkeley.github.io 获取。

关键词

引用

@article{arxiv.2503.15485,
  title  = {TULIP: Towards Unified Language-Image Pretraining},
  author = {Zineng Tang and Long Lian and Seun Eisape and XuDong Wang and Roei Herzig and Adam Yala and Alane Suhr and Trevor Darrell and David M. Chan},
  journal= {arXiv preprint arXiv:2503.15485},
  year   = {2025}
}

备注

(v2) Clarified fine-tuning process, updated appendix