为何在VQA与推理中情境至关重要:面向VLM输入模态的语义干预
人工智能
2024-10-03 v1
摘要
生成式AI的各种局限性(如幻觉和模型失效)使得理解不同模态在视觉语言模型(VLM)预测中的作用变得至关重要。我们的工作调查了图像和文本模态信息的集成如何影响VLM在视觉问答(VQA)和推理任务中的性能和行为。我们通过准确率、推理质量、模型不确定性和模态相关性来衡量此效果。我们研究了文本和图像模态在不同配置下的相互作用,这些配置对于解决VQA任务至关重要。我们的贡献包括(1)Semantic Interventions(SI)-VQA数据集、(2)在不同模态配置下对各种VLM架构的基准研究,以及(3)Interactive Semantic Interventions(ISI)工具。SI-VQA数据集为基准提供了基础,而ISI工具提供了一个界面,用于在图像和文本输入中测试和应用语义干预,实现更细致的分析。我们的結果表明,模态之间的互补信息可提高答案和推理质量,而相互矛盾的信息则损害模型性能和信心。图像文本注释对准确率和不确定性影响最小,略增加图像相关性。注意力分析确认了图像输入在VQA任务中的主导作用。在本研究中,我们评估了能够为每个模态提取注意力系数的前沿VLM。一个关键发现是PaliGemma的有害过度自信,这种风险在LLaVA模型中更高。该工作为严格的模态集成分析奠定了基础,支持特定为此目的设计的数据集。
引用
@article{arxiv.2410.01690,
title = {Why context matters in VQA and Reasoning: Semantic interventions for VLM input modalities},
author = {Kenza Amara and Lukas Klein and Carsten Lüth and Paul Jäger and Hendrik Strobelt and Mennatallah El-Assady},
journal= {arXiv preprint arXiv:2410.01690},
year = {2024}
}