洞察于视觉:探索多模态大语言模型中的视觉知识冲突
计算与语言
2025-06-03 v2 计算机视觉与模式识别
摘要
本文探讨了多模态大语言模型(MLLMs)中常见的范畴级视觉知识冲突问题,即视觉信息与模型内部常识知识相矛盾。为研究此问题,我们引入了一个自动化框架,并辅以人类在环质量控制,生成旨在模拟和评估MLLMs中这些冲突的输入。通过该框架,我们构建了一个诊断性基准测试,包含374个原创图像和1,122个高质量的问答(QA)对。该基准测试涵盖两种冲突维度和三种问题类型,提供了全面的评估工具。我们将该基准测试应用于评估来自不同模型家族的九个代表性MLLMs的冲突解决能力。结果表明,约20%的所有查询在参数化知识方面存在显著过度依赖,尤其是在Yes-No问题和与动作相关的问题中。基于这些发现,我们评估了现有方法的效果,并与我们的“聚焦于视觉”提示策略进行了比较。尽管取得了一些改进,视觉知识冲突仍未得到彻底解决,通过我们的数据构建框架可进一步扩展。我们提出的框架、基准测试和分析工作为理解和缓解MLLMs中的视觉知识冲突作出了贡献。
引用
@article{arxiv.2410.08145,
title = {Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs},
author = {Xiaoyuan Liu and Wenxuan Wang and Youliang Yuan and Jen-tse Huang and Qiuzhi Liu and Pinjia He and Zhaopeng Tu},
journal= {arXiv preprint arXiv:2410.08145},
year = {2025}
}
备注
Accepted by ACL 2025 main