别学,找依托:自然语言推理中的视觉依托方法
计算与语言
2025-11-24 v1
摘要
我们提出了一种用于自然语言推理(NLI)的零样本方法,利用多模态表示通过将语言 grounding 在视觉语境中。我们的 approach 通过文本到图像模型生成 premise 的视觉表示,并通过与文本假设进行比较来执行推理。我们评估了两种推理技术:余弦相似度和视觉问答。该方法在无需任务特定微调的情况下即可实现高准确率,显示出对文本偏见和表面启发式方法的鲁棒性。此外,我们设计了一个受控的对抗数据集以验证该方法的鲁棒性。我们的发现表明,将视觉模态作为意义表示具有为稳健的自然语言理解指明了一条有前景的道路。
引用
@article{arxiv.2511.17358,
title = {Don't Learn, Ground: A Case for Natural Language Inference with Visual Grounding},
author = {Daniil Ignatev and Ayman Santeer and Albert Gatt and Denis Paperno},
journal= {arXiv preprint arXiv:2511.17358},
year = {2025}
}