半真实信息破坏基于相似性的检索
计算机视觉与模式识别
2026-03-02 v1
摘要
当文本描述被附加一个额外细节时,如果该细节错误,图像-文本相似性分数应随之下降。我们展示了 CLIP 等双编码器模型常常违反这一直觉:将一个合理但不正确的物体或关系附加到正确的描述上,可能会增加相似性得分。我们称此类情况为半真实信息。COCO 数据集上,CLIP 仅在 40.6% 的情况下优先选择正确的较短描述,当添加的细节为关系时,性能下降至 32.9%。我们将此漏洞追溯到对描述部分的弱监督:对比学习仅对完整句子进行对齐,而未明确强制各实体和关系 individually 被正确对齐。我们提出 CS-CLIP(Component-Supervised CLIP),将描述分解为实体和关系单元,为每个单元构建最小编辑版的伪造描述,然后对模型进行微调,使其在保持标准双编码器推断的前提下,对正确单元得分高于其伪造单元。CS-CLIP 将半真实信息准确率提升至 69.3%,并在 established 的组合基准测试上提升平均 5.7 分,表明减少半真实信息错误与更广泛的组合理解提升是一致的。代码已公开:https://github.com/kargibora/CS-CLIP
引用
@article{arxiv.2602.23906,
title = {Half-Truths Break Similarity-Based Retrieval},
author = {Bora Kargi and Arnas Uselis and Seong Joon Oh},
journal= {arXiv preprint arXiv:2602.23906},
year = {2026}
}