中文

通过视觉蕴涵任务探究视觉语言理解:机遇与陷阱

计算机视觉与模式识别 2025-07-24 v1 人工智能

摘要

本研究检验了视觉蕴涵(VE)任务是否作为多模态语言模型视觉语言理解的可靠探针,使用 LLaMA 3.2 11B 视觉模型作为测试案例。除报告性能指标外,我们旨在解释这些结果揭示的关于 VE 任务潜在可能性与局限性。我们在零样本、few-shot 和 fine-tuning 设置下开展系列实验,探讨提示设计、上下文示例的数量与顺序以及视觉信息获取可能如何影响 VE 性能。为进一步探究模型的推理过程,我们采用解释性评估方法。结果表明,三样本推理优于零样本基线。然而,额外的示例引入的噪声超过其提供的益处。此外,提示中标签的顺序是影响预测的关键因素。在缺乏视觉信息时,模型倾向于幻觉并想象内容,这引发了关于模型过度依赖语言先验的质疑。微调后 achieves 83.3% 的准确率,优于最新 SOTA 模型 OFA-X。此外,解释评估显示,微调后模型提供的解释在语义上类似于人类,BERTScore F1 分数为 89.2%。我们发现,受限视觉的实验也得到相当的 BERTScore 分数,质疑了该任务的视觉 grounding。总体而言,我们的结果凸显了 VE 作为诊断性任务的实用性与局限性,并指出了完善多模态评估方法的方向。

关键词

引用

@article{arxiv.2507.17467,
  title  = {Probing Vision-Language Understanding through the Visual Entailment Task: promises and pitfalls},
  author = {Elena Pitta and Tom Kouwenhoven and Tessa Verhoef},
  journal= {arXiv preprint arXiv:2507.17467},
  year   = {2025}
}

备注

LUHME: 2nd Workshop on Language Understanding in the Human-Machine Era