中文

思维谱系:通过模型合并对大语言模型中可调推理的实证研究

人工智能 2025-09-30 v2 计算与语言

摘要

对具有可调推理能力的大语言模型(LLM)在众多现实世界应用中的日益增长的需求,凸显了对能够高效生成在推理深度和计算成本之间取得平衡的模型谱系的方法的迫切需求。模型合并作为一种有前景的无训练技术,通过算术组合通用模型与专用推理模型的权重来解决这一挑战。虽然存在各种合并技术,但它们在创建具有推理能力的细粒度控制的模型谱系方面的潜力仍 largely 未被探索。本工作呈现了一项大规模实证研究,评估了多种推理基准上的多种模型合并技术。我们系统地变化合并强度以构建准确度-效率曲线,提供了对可调性能景观的首次全面视图。我们的发现表明,模型合并提供了一种有效且可控的方法来校准推理准确度与令牌效率之间的权衡,即使父模型具有高度发散的权重空间。关键的是,我们识别出帕累托改进的实例——合并模型同时实现了比其某个父模型更高的准确度和更低的令牌消耗。本研究提供了对该可调空间的首次全面分析,为创建具有特定推理画像的 LLM 以满足多样化应用需求提供了实用指南。

关键词

引用

@article{arxiv.2509.22034,
  title  = {The Thinking Spectrum: An Empirical Study of Tunable Reasoning in LLMs through Model Merging},
  author = {Xiaochong Lan and Yu Zheng and Shiteng Cao and Yong Li},
  journal= {arXiv preprint arXiv:2509.22034},
  year   = {2025}
}