中文

RCP-Merging:将推理能力视为先验的长链-of-thought 模型与领域特定模型合并

计算与语言 2026-01-21 v2 人工智能

摘要

具备长链-of-thought (CoT) 能力的大型语言模型(称为推理模型)通过多步骤长 CoT 推理展现出卓越的复杂问题解决能力。为了在不产生大量计算和数据成本的情况下创建具备长 CoT 能力和领域特定知识的双重能力模型,模型合并方法显示出高度的资源效率。然而,当前的合并方法在合并领域特定 LLM 与长 CoT 模型时面临推理能力退化、输出胡说和输出崩溃等严重挑战。为克服这一问题,我们提出了 RCP-Merging:一种将长 CoT 模型与领域特定模型合并的新型框架,旨在整合领域特定 LLM 的长 CoT 能力,同时保持原有领域中的模型性能。将推理模型权重视为基础先验,我们的方法利用推理能力指示器保留核心长 CoT 能力模型权重,同时选择性地合并关键的领域特定权重。我们在 Qwen2.5-7B、Llama3.1-8B 和 Qwen2.5-1.5B 模型上进行了针对 BioMedicine 和 Finance 领域的广泛实验。我们的结果表明,RCP-Merging 成功地将推理模型与领域特定模型相合并,使领域任务性能相较于最先进的方法提升了 9.5% 和 9.2%,而不会显著损害原始的长 CoT 推理能力。

关键词

引用

@article{arxiv.2508.03140,
  title  = {RCP-Merging: Merging Long Chain-of-Thought Models with Domain-Specific Models by Considering Reasoning Capability as Prior},
  author = {Junyao Yang and Jianwei Wang and Huiping Zhuang and Cen Chen and Ziqian Zeng},
  journal= {arXiv preprint arXiv:2508.03140},
  year   = {2026}
}

备注

15 pages, 7 figures