CLIP 通过指令编辑数据和长标题提升细粒度视觉理解
计算机视觉与模式识别
2025-11-18 v5
摘要
尽管Vision-Language Models(VLMs)如CLIP在视觉语言对齐方面取得了成功,但其在细粒度视觉理解方面的专业能力仍是关键挑战。我们提出CLIP-IN框架,通过两种核心创新提升CLIP的细粒度感知。首先,我们利用指令编辑数据集(最初用于图像操纵)作为困难负面图像文本对的独特来源。结合对称硬负面对比损失,使模型能够有效区分细微的视觉语义差异。其次,CLIP-IN包含长描述性标题,利用旋转位置编码捕获标准CLIP常忽视的丰富语义上下文。我们的实验表明,CLIP-IN在MMVP基准和各种细粒度视觉识别任务上均取得显著提升,且不损害在更广泛分类和检索任务上的鲁棒零样性能。关键的是,将CLIP-IN的视觉表示集成到多模态大语言模型中,可显著减少视觉幻觉并增强推理能力。这一工作凸显了将针对性指令基对比学习与全面描述性信息相结合,以提升VLMs细粒度理解潜力的重要性。
引用
@article{arxiv.2508.02329,
title = {VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction Editing Data and Long Captions},
author = {Ziteng Wang and Siqi Yang and Limeng Qiao and Lin Ma},
journal= {arXiv preprint arXiv:2508.02329},
year = {2025}
}
备注
Accepted to NeurIPS 2025