中文

GPT-4V 在知识密集型视觉问答上的综合评测

计算与语言 2024-08-27 v3

摘要

多模态大模型(MLMs)的出现显著推动了视觉理解领域的发展,在视觉问答(VQA)方面提供了卓越的能力。然而,真正的挑战在于知识密集型 VQA 任务,这类任务不仅需要对视觉元素的识别,还需要将视觉信息与其所掌握的大量知识深度融合理解。为揭示 MLMs(尤其是新推出的 GPT-4V 和 Gemini)的此类能力,我们从三个角度进行了深入评测:1)常识知识,评估模型理解视觉线索并关联到通用知识的能力;2)细粒度世界知识,测试模型从图像中推理出特定知识的能力,展现其在各专门领域的熟练度;3)带决策依据的综合性知识,考察模型为其推断提供逻辑解释的能力,从可解释性视角促成更深入的分析。此外,我们采用视觉知识增强训练策略和多模态检索增强生成方法来提升 MLMs,凸显了该研究方向未来所需的进展。大量实验表明:a) GPT-4V 在使用合成图像作为少样本时,解释生成能力增强;b) GPT-4V 及其他 MLMs 在处理世界知识时产生严重幻觉;c) 视觉知识增强训练与提示技术展现出提升性能的潜力。代码:https://github.com/HITsz-TMG/Cognitive-Visual-Language-Mapper

关键词

引用

@article{arxiv.2311.07536,
  title  = {A Comprehensive Evaluation of GPT-4V on Knowledge-Intensive Visual Question Answering},
  author = {Yunxin Li and Longyue Wang and Baotian Hu and Xinyu Chen and Wanqi Zhong and Chenyang Lyu and Wei Wang and Min Zhang},
  journal= {arXiv preprint arXiv:2311.07536},
  year   = {2024}
}

备注

20 pages, 15 pages; technical paper