中文

视觉与语言解码器是否同等使用图像与文本?其解释的自洽性如何?

计算与语言 2025-05-05 v4 人工智能 计算机视觉与模式识别 机器学习

摘要

视觉与语言模型 (VLM) 解码器是目前在多模态任务上性能最佳的架构。除答案外,它们还能在后置或思维链 (CoT) 设置下生成自然语言解释。然而,目前尚不清楚它们在生成答案或解释时在多大程度上使用了输入的视觉和文本模态。在这项工作中,我们研究了 VLM 在生成解释与生成答案时是否对输入模态的依赖有所不同。我们还通过将现有的单模态测试和度量扩展到 VLM 解码器,评估了 VLM 解码器在后置和 CoT 解释设置下的自洽性。我们发现,大多数受测 VLM 的自洽性不如 LLM。在所有考察的任务中,所有受测 VL 解码器中文本的贡献均比图像的贡献更重要。然而,当比较解释生成与答案生成时,图像对生成解释的贡献显著强于对生成答案的贡献。与后置解释相比,这种差异在 CoT 中甚至更大。最后,我们在 VALSE 基准上提供了最先进的 VL 解码器的最新基准测试,该基准此前仅限于 VL 编码器。我们发现,受测 VL 解码器在 VALSE 测试的大多数现象上仍然存在困难。

关键词

引用

@article{arxiv.2404.18624,
  title  = {Do Vision & Language Decoders use Images and Text equally? How Self-consistent are their Explanations?},
  author = {Letitia Parcalabescu and Anette Frank},
  journal= {arXiv preprint arXiv:2404.18624},
  year   = {2025}
}

备注

30 pages, 8 figures, 11 tables