揭示多模态大语言模型的认知盲区:看得清,答不对
计算机视觉与模式识别
2025-03-20 v3
摘要
多模态大语言模型在多模态任务中,尤其是在视觉理解方面,展现了卓越的性能。然而,我们发现,即使模型理解了视觉内容,它们也常常生成错误的答案。为此,我们人工构建了一个包含12个类别的基准测试集,并设计了评估指标,用以衡量模型在看似理解视觉内容的情况下,其回答的错误程度。基于该基准,我们测试了15个领先的多模态大语言模型,并分析了部分模型的注意力图分布和logits。我们的研究识别出两个主要问题:1) 大多数指令微调数据集主要包含与视觉内容“直接”相关的问题,导致模型对其他间接问题的回答存在偏差;2) 模型对视觉标记的注意力显著低于对系统标记和问题标记的注意力。我们进一步观察到,与直接问题相比,模型在面对误导性问题时,问题与视觉标记之间的注意力分数以及模型对答案的置信度都较低。针对第一个挑战,我们引入了一种配对的正面和负面数据构建流程,以丰富数据集的多样性。针对第二个挑战,我们提出通过在解码过程中优化文本和视觉提示来增强模型对视觉内容的关注。对于文本提示,我们提出了一种内容引导的优化策略,该策略在回答问题前进行初步的视觉内容分析,以生成结构化信息。此外,我们采用了一种视觉注意力优化策略,该策略突出显示与问题相关的视觉标记,以增加模型对与问题一致的视觉内容的注意力。大量实验表明,我们提出的数据集和技术可以显著缓解这些挑战。
引用
@article{arxiv.2406.10638,
title = {Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly},
author = {Yexin Liu and Zhengyang Liang and Yueze Wang and Xianfeng Wu and Feilong Tang and Muyang He and Jian Li and Zheng Liu and Harry Yang and Sernam Lim and Bo Zhao},
journal= {arXiv preprint arXiv:2406.10638},
year = {2025}
}