中文

TNG-CLIP:训练时否定数据生成以提升CLIP的否定感知能力

计算机视觉与模式识别 2025-05-27 v1 人工智能

摘要

视觉语言模型(VLM)如CLIP已在广泛的下游任务中展现出强大的性能。然而,CLIP在否定理解方面仍存在局限,即识别概念缺失或排除的能力。现有方法通过使用大型语言模型(LLM)生成大量包含否定表述的图像描述,以进行进一步微调来解决此问题。然而,这些方法既耗时又计算密集,其评估通常仅限于图像-文本匹配任务。为拓展视野,我们(1)引入一种训练时否定数据生成管道,使否定描述可在训练阶段生成,仅增加2.5%的额外训练时间;(2)我们提出首个基准,Neg-TtoI,用于评估包含否定提示的文本到图像生成模型,评估模型生成语义准确图像的能力。我们表明,提出的方法TNG-CLIP在多样化的否定基准测试中(包括图像到文本匹配、文本到图像检索和图像生成)实现了最先进的性能。

关键词

引用

@article{arxiv.2505.18434,
  title  = {TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP},
  author = {Yuliang Cai and Jesse Thomason and Mohammad Rostami},
  journal= {arXiv preprint arXiv:2505.18434},
  year   = {2025}
}

备注

15 pages, 3 figures