快还是慢?融合快速直觉与审慎思考以增强视觉问答
计算与语言
2025-06-03 v1
摘要
多模态大语言模型(MLLMs)在视觉问答(VQA)的复杂推理任务中仍然存在困难。尽管当前方法通过引入视觉提示取得了进展,但我们的研究揭示了关键局限性:这些方法为每个视觉问题不加区分地标注所有检测到的物体,生成过多的视觉标记,从而降低任务性能。该问题主要源于对关键视觉元素缺乏关注,这引出了两个重要问题:所有物体是否同等重要?所有问题是否都需要视觉提示?受区分人类推理中直觉与审慎认知模式的双过程理论启发,我们提出 FOCUS,一种即插即用的方法,能够动态适应问题的复杂度,将快速直觉判断与审慎分析推理相结合,以增强 MLLM 的视觉语言推理能力。对于简单问题,FOCUS 支持高效的零样本推理。对于更复杂的任务,它采用“观察前概念化”策略以突出关键元素。在 ScienceQA、TextQA、VizWiz 和 MME 四个基准上的大量实验表明,FOCUS 持续提升开源和黑盒 MLLMs 的性能,在所有数据集上均取得显著增益。消融研究进一步验证了将多样化认知策略与精细视觉信息相结合对于实现卓越性能的重要性。代码将发布。
引用
@article{arxiv.2506.00806,
title = {Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering},
author = {Songtao Jiang and Chenyi Zhou and Yan Zhang and Yeying Jin and Zuozhu Liu},
journal= {arXiv preprint arXiv:2506.00806},
year = {2025}
}