中文

HQ-CLIP:利用大型视觉语言模型创建高质量图像-文本数据集与CLIP模型

计算机视觉与模式识别 2025-07-31 v1

摘要

大规模但噪声较大的图像-文本配对数据为Contrastive Language-Image Pretraining(CLIP)的成功提供了可能。作为基础视觉编码器,CLIP反过来又是大多数大型视觉语言模型(LVLMs)的基石。这一相互依存关系自然引出了一个有趣的问题:我们能否反过来利用LVLMs来提高图像-文本配对数据的质量,从而开启持续改进的自强化循环?本文致力于此目标,提出一种以LVMM驱动的数据精炼管道。我们的框架利用LVLMs处理图像及其原始备选文本,生成四种互补的文本公式:长正面描述、长负面描述、短正面标签和短负面标签。将该管道应用于精选的DFN-Large数据集,得到VLM-150M,一个被多层次注释丰富的数据集。基于此数据集,我们进一步提出一种训练范式,将传统对比学习扩展为融合负面描述和短标签作为额外监督信号。最终得到的模型即HQ-CLIP,在各种基准测试中均显示出显著的性能提升。在相当相同的训练数据规模下,我们的方法在零样本分类、跨模态检索和细粒度视觉理解任务中实现了最新成绩。在检索基准测试中,HQ-CLIP甚至超越了在DFN-2B数据集上训练的标准CLIP模型,而该数据集包含我们数据的10倍。所有代码、数据和模型均可在https://zxwei.site/hqclip 访问。

关键词

引用

@article{arxiv.2507.22431,
  title  = {HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models},
  author = {Zhixiang Wei and Guangting Wang and Xiaoxiao Ma and Ke Mei and Huaian Chen and Yi Jin and Fengyun Rao},
  journal= {arXiv preprint arXiv:2507.22431},
  year   = {2025}
}