中文

通过模型合并实现高效长短 LLM 推理

计算与语言 2025-05-26 v2

摘要

大型语言模型(LLM)从系统 1 推理过渡到系统 2 推理,标志着在通过深思熟虑、迭代思考来处理复杂任务方面取得了显著进展。然而,这种进步往往以效率为代价,因为模型倾向于生成冗余的推理步骤,而未呈现出与之成比例的输出质量提升。长短(Long-to-Short,L2S)推理已然成为解决这一挑战的有前景的方案,旨在在推理深度与实际效率之间取得平衡。虽然监督微调(SFT)、强化学习(RL)和提示工程等现有方法显示出潜力,但它们要么计算昂贵,要么不稳定。相比之下,模型合并作为一种集成系统 1 模型快速思考能力与系统 2 模型方法论推理能力的替代方案,具有成本效益高且鲁棒性强。本文我们进行了关于模型合并用于 L2S 推理的全面实证研究,探索了包括基于任务向量、基于奇异值分解和基于激活的合并方法。我们的实验表明,模型合并可将平均响应长度缩短最高 55%,同时保持甚至提升基线性能。我们还在 15B/7B/14B/32B 模型上识别到模型规模与合并效果之间的强相关性。此外,我们还探讨了合并后模型的自我批判和自我纠正能力,以及其基于任务复杂性的自适应响应长度。我们的发现表明,模型合并是 L2S 推理中高度高效且有效的范式,为解决过思考问题提供了实用方案,同时保持系统 2 推理的鲁棒性。本工作可在 Github 上获得 https://github.com/hahahawu/Long-to-Short-via-Model-Merging。

关键词

引用

@article{arxiv.2503.20641,
  title  = {Unlocking Efficient Long-to-Short LLM Reasoning with Model Merging},
  author = {Han Wu and Yuxuan Yao and Shuqi Liu and Zehua Liu and Xiaojin Fu and Xiongwei Han and Xing Li and Hui-Ling Zhen and Tao Zhong and Mingxuan Yuan},
  journal= {arXiv preprint arXiv:2503.20641},
  year   = {2025}
}

备注

Technical report