中文

知 "否" 更好:基于数据驱动方法提升 CLIP 中的否定认知能力

计算机视觉与模式识别 2026-02-11 v3 计算与语言

摘要

尽管 CLIP 已通过桥接视觉与语言方面显著推动了多模态理解,但其无法理解否定——例如,无法区分 "停车" 与 "不可停车" 的概念——仍是重大挑战。通过分析 CLIP 模型预训练所使用的数据,我们认为这一局限性源于缺乏包含否定内容的训练数据。为此,我们引入数据生成管道,运用大型语言模型(LLM)和多模态 LLM 生成包含否定内容的描述文本。通过使用我们管道生成的数据对 CLIP 进行微调,我们开发了 NegationCLIP,以提升其对否定的认知能力,同时保持其通用性。此外,为实现对否定理解能力的全面评估,我们提出 NegRefCOCOg—a 用于测试视觉语言模型(VLMs)在句子中不同位置和多样化表达下解释否定能力的基准数据集。various CLIP 架构的实验表明,我们的数据生成管道在提升 CLIP 准确感知否定方面效果显著。进一步地,NegationCLIP 增强后的否定认知能力在多个多模态任务中具有实际应用价值,表现出在文本到图像生成和指涉图像分割等任务上的性能提升。

关键词

引用

@article{arxiv.2501.10913,
  title  = {Know "No" Better: A Data-Driven Approach for Enhancing Negation Awareness in CLIP},
  author = {Junsung Park and Jungbeom Lee and Jongyoon Song and Sangwon Yu and Dahuin Jung and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2501.10913},
  year   = {2026}
}

备注

Accepted to ICCV 2025