中文

CLIP 通过指令编辑数据和长标题提升细粒度视觉理解

计算机视觉与模式识别 2025-11-18 v5

摘要

尽管Vision-Language Models(VLMs)如CLIP在视觉语言对齐方面取得了成功,但其在细粒度视觉理解方面的专业能力仍是关键挑战。我们提出CLIP-IN框架,通过两种核心创新提升CLIP的细粒度感知。首先,我们利用指令编辑数据集(最初用于图像操纵)作为困难负面图像文本对的独特来源。结合对称硬负面对比损失,使模型能够有效区分细微的视觉语义差异。其次,CLIP-IN包含长描述性标题,利用旋转位置编码捕获标准CLIP常忽视的丰富语义上下文。我们的实验表明,CLIP-IN在MMVP基准和各种细粒度视觉识别任务上均取得显著提升,且不损害在更广泛分类和检索任务上的鲁棒零样性能。关键的是,将CLIP-IN的视觉表示集成到多模态大语言模型中,可显著减少视觉幻觉并增强推理能力。这一工作凸显了将针对性指令基对比学习与全面描述性信息相结合,以提升VLMs细粒度理解潜力的重要性。

关键词

引用

@article{arxiv.2508.02329,
  title  = {VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction Editing Data and Long Captions},
  author = {Ziteng Wang and Siqi Yang and Limeng Qiao and Lin Ma},
  journal= {arXiv preprint arXiv:2508.02329},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025