中文

多模态大语言模型中的免训练推理与反思

计算机视觉与模式识别 2025-05-23 v1

摘要

推理大语言模型(例如 DeepSeek-R1 和 OpenAI-o1)的最新进展通过强化学习展示了令人印象深刻的推理能力。然而,将这些能力扩展到多模态大语言模型受到高昂的再训练成本以及高质量、可验证的多模态推理数据集稀缺的阻碍。本文介绍了 FRANK 模型,这是一种免训练且类似 R1 的多模态大语言模型,它无需任何梯度更新或额外监督,即可为现成的多模态大语言模型注入推理和反思能力。我们的关键见解是将感知和推理在多模态大语言模型解码器层间解耦。具体来说,我们观察到,与较深的解码器层相比,较浅的解码器层对视觉标记分配了更多注意力,而较深的解码器层则集中于文本语义。这一观察启发了一种分层权重合并方法,将视觉预训练的多模态大语言模型与推理专用的 LLM 相结合。为此,我们提出了一种逐层、基于泰勒推导的闭式融合机制,将推理能力整合到深层解码器层,同时保留浅层解码器层的视觉基础。在具有挑战性的多模态推理基准上的广泛实验证明了我们方法的有效性。在 MMMU 基准测试中,我们的模型 FRANK-38B 达到了 69.2 的准确率,比最强基线 InternVL2.5-38B 高出 +5.3,甚至超越了闭源模型 GPT-4o。我们的项目主页位于:http://iip.whu.edu.cn/frank/index.html

关键词

引用

@article{arxiv.2505.16151,
  title  = {Training-Free Reasoning and Reflection in MLLMs},
  author = {Hongchen Wei and Zhenzhong Chen},
  journal= {arXiv preprint arXiv:2505.16151},
  year   = {2025}
}