多模态 LLM 是否可从 LLM 中“免费”吸收数学推理能力?
人工智能
2025-10-17 v1
摘要
数学推理是大型语言模型(LLM)的关键能力,近年来取得了显著进展。然而,大多数工作聚焦于 LLM,通过构建高质量标注数据和复杂的训练(或推理)范式来提升表现,而多模态 LLM(MLLMs)的数学推理性能仍落后于人类。由于 MLLM 通常由 LLM 和视觉模块组成,我们疑问:是否可以直接从即插即用的数学 LLM 中获取数学推理能力,而无需调参?最近的模型合并方法可能为此提供了思路。然而,这些方法忽略了 MLLM 与 LLM 之间的对齐问题,我们发现两者的参数空间之间存在较大差距,导致性能较差。我们的实证证据揭示了这一问题的两个关键因素:识别关键推理关联层的作用以及缓解参数空间差距的作用。基于实证见解,我们提出了 IP-Merging 方法,首先识别 MLLM 和数学 LLM 中与推理相关的关键参数,然后将其投射到 MLLM 的子空间中,以维持对齐,最后在该子空间中进行参数合并。IP-Merging 是一种无需调参的方法,因为参数直接被调整。广泛的实验表明,我们的 IP-Merging 方法可以直接从数学 LLM 中提升 MLLM 的数学推理能力,而不会损害其其他能力。
引用
@article{arxiv.2510.14387,
title = {Can MLLMs Absorb Math Reasoning Abilities from LLMs as Free Lunch?},
author = {Yijie Hu and Zihao Zhou and Kaizhu Huang and Xiaowei Huang and Qiufeng Wang},
journal= {arXiv preprint arXiv:2510.14387},
year = {2025}
}