基于费舍尔信息的无数据层自适应合并用于长转短推理大语言模型
机器学习
2026-03-24 v1
摘要
模型合并已成为一种无需额外训练即可组合专用大语言模型(LLMs)能力的实用方法。在长转短(L2S)场景中,合并基础模型与长链思维推理模型旨在保持推理准确性的同时减少输出长度。现有方法依赖于任务算术及其变体,这些方法隐含地假设模型输出随合并系数线性变化——我们证明这一假设在长转短设置中被系统性地违背。我们首次为层自适应合并提供了理论证明:我们证明了合并误差受一个与每层海森范数成正比的项所界定(命题1),并基于局部最优处的费舍-海森等价性,确立了费舍信息矩阵(FIM)是该界的一个原则性且可计算的代理。基于这一理论,我们提出了 FIM-Merging,该方法仅使用随机令牌输入(无需特定领域的校准数据)计算对角费舍信息矩阵,并利用其为每层分配合并系数。在7B长转短基准测试上,FIM-TIES在六个评估基准中的五个上取得了最先进的性能,包括在MATH500上比ACM-TIES提高了\textbf{+6.2}分(90.2 vs. 84.0),且无需任何校准数据。在1.5B基准测试上,FIM-TIES取得了\textbf{47.3}的平均准确率,比之前最佳的ACM-TIES(43.3)高出\textbf{+3.9}分,同时相对于长链思维模型,平均响应长度减少了\textbf{91.9\%}。我们的框架还为现有层自适应方法(如ACM)为何在经验上优于均匀合并提供了统一的理论解释。
引用
@article{arxiv.2603.21705,
title = {Data-Free Layer-Adaptive Merging via Fisher Information for Long-to-Short Reasoning LLMs},
author = {Tian Xia},
journal= {arXiv preprint arXiv:2603.21705},
year = {2026}
}
备注
14 pages, NeurIPS 2026 submission