中文

自然语言推理提升视觉-语言模型中的组合性

计算与语言 2024-10-30 v1 计算机视觉与模式识别

摘要

视觉-语言模型中的组合推理仍然具有挑战性,因为这些模型常常难以关联物体、属性和空间关系。近期的方法旨在通过依赖文本描述的语义来解决这些局限性,利用大型语言模型(LLM)将其分解为子集的问答对。然而,这些方法主要在表层操作,未能融入更深层的词汇理解,同时引入了由LLM生成的错误假设。针对这些问题,我们提出了基于蕴含与矛盾的描述扩展(CECE),这是一种利用自然语言推理(NLI)从给定前提生成蕴含和矛盾的原则性方法。CECE在保持核心语义的同时,生成词汇上多样化的句子。通过大量实验,我们表明CECE增强了解释性并减少了对有偏或表面特征的过度依赖。通过将CECE与原始前提进行平衡,我们在不进行额外微调的情况下,相较于先前方法取得了显著改进,在评估图像-文本对齐与人类判断一致性的基准测试上取得了最先进的结果,并在Winoground上实现了+19.2%(组分数)的性能提升,在EqBen上实现了+12.9%(组分数)的性能提升,超越了之前的最佳工作(使用目标数据微调)。

关键词

引用

@article{arxiv.2410.22315,
  title  = {Natural Language Inference Improves Compositionality in Vision-Language Models},
  author = {Paola Cascante-Bonilla and Yu Hou and Yang Trista Cao and Hal Daumé and Rachel Rudinger},
  journal= {arXiv preprint arXiv:2410.22315},
  year   = {2024}
}

备注

Project page: https://cece-vlm.github.io/