Omni-NegCLIP:通过前端层对比微调增强 CLIP 的全面否定理解
计算机视觉与模式识别
2026-05-05 v2 人工智能
摘要
视觉-语言模型(VLMs)在广泛的模态任务中已展现出强大能力。然而,最近的研究表明,CLIP 等 VLMs 在理解自然语言中常见的否定表达式方面表现不佳。在这项工作中,我们提出了 Omni-NegCLIP,一个经过微调的 CLIP 模型,通过修改 CLIP 原始的 InfoNCE 对比损失来改善 CLIP 对两种否定类型的理解,即基于存在的否定和基于缺失的否定,分别对应图像中实际存在的对象的否定表达式和可能在图像中合理存在但实际不存在的对象的否定表达式。具体而言,我们设计了一个基于存在的对比目标,将图像嵌入拉向其原始标题嵌入,同时将其推开对应的基于存在的否定标题嵌入;并设计了一个基于缺失的对比目标,将图像嵌入与原始标题嵌入和基于缺失的否定标题嵌入对齐,同时保持两个文本嵌入之间的语义区分。基于我们观察到 CLIP 文本编码器的前端 Transformer 层对否定文本的学习能力比后端层更强,我们在每个训练步骤中使用组合对比目标微调 CLIP 文本编码器的前端 Transformer 层。实验结果表明,与预训练 CLIP 相比,Omni-NegCLIP 在基于存在的否定任务和基于缺失的否定任务上分别提升了最多 52.65% 和 12.50%,同时未牺牲图像-文本检索的通用能力,甚至将其提升了最多 19.62%。与先前工作相比,Omni-NegCLIP 展现了对多种否定任务更全面的理解能力。
引用
@article{arxiv.2603.29258,
title = {Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding},
author = {Jingqi Xu},
journal= {arXiv preprint arXiv:2603.29258},
year = {2026}
}