中文

基于 paraphrasing 与否定的对比式视觉语言学习

计算机视觉与模式识别 2025-11-21 v1 机器学习

摘要

对比式视觉语言模型是图像和文本检索的主流方法。对比式语言图像预训练(Contrastive Language-Image Pre-training, CLIP)通过对比方式训练两个神经网络,将其图像和文本嵌入对齐到共享的潜在空间。最近的评估结果表明,CLIP在处理否定或改写文本时表现混合,这是因为否定会以最小词汇变化导致意义根本性改变,而改写则可能以完全不同的文本表达式表达相同意图。这对提高评估结果和视觉语言模型的对齐性构成重大挑战。为此,本文评估了改写与否定的组合,提出一种考虑改写与否定的新型CLIP对比损失函数,并应用LLM生成的训练三元组(包括原文、改写文本和否定文本)进行CLIP类训练。该方法称为SemCLIP,实验证明SemCLIP可将改写文本嵌入引导 toward 原图像嵌入,同时将否定文本嵌入推远离原图像嵌入。实验表明,SemCLIP在保持CLIP性能的同时,显著增加了到否定文本的距离。在CC-Neg基准上使用原明细化/否定图像检索准确率指标,SemCLIP的准确率从68.1%提升至78.1%。尽管在Sugarcrepe++基准上与CLIP比较结果不稳定,SemCLIP的整体表现优于仅使用否定文本训练的模型。这种对否定的鲁棒性也体现在下游零样本分类任务上,SemCLIP在Sugarcrepe++上预训练后在所有测试下游任务中均优于CLIP。这表明SemCLIP能够实现对语义转换的显著鲁棒性。

关键词

引用

@article{arxiv.2511.16527,
  title  = {Contrastive vision-language learning with paraphrasing and negation},
  author = {Kwun Ho Ngan and Saman Sadeghi Afgeh and Joe Townsend and Artur d'Avila Garcez},
  journal= {arXiv preprint arXiv:2511.16527},
  year   = {2025}
}