中文

AlignMerge——通过Fisher引导几何约束实现保持对齐的大语言模型合并

人工智能 2025-12-19 v1

摘要

合并大语言模型(LLM)是一种在不重新训练的情况下组合多个微调检查点能力的实用方法。然而,标准方案(线性权重平均、任务向量和Fisher加权平均)虽然可以保持损失,但会悄然破坏对齐。我们认为合并不是数值技巧,而是一种围绕已对齐锚点的几何约束操作:融合必须被引导以尊重安全几何,而非事后验证。我们提出了AlignMerge,一个将对齐作为显式不变量的几何感知合并框架。在指令微调基底的局部Fisher图中,我们估计一个对齐子空间投影器P_A,并优化:L_AlignMerge = L_geo + lambda_align * L_align + lambda_bud * L_bud,其中L_geo使合并靠近其专家在Fisher-Rao几何中的位置,L_align惩罚沿对齐敏感方向的运动,L_bud强制执行软对齐预算。作为对齐函数式,我们使用解码不变的对齐质量指数(AQI),这是一个捕获对齐和未对齐行为在表示空间中如何清晰分离的潜在空间标准。在五个模型族(LLaMA-3 8B、Mistral 7B、Qwen 2、Phi-3.5、Gemma 2)上,将安全锚点与任务专家合并,AlignMerge在对齐指标(AQI、毒性、LLM-judge对齐)上有所提升,同时在指令遵循、推理和有用性方面匹配或超越了最佳专家。它还表现出比Fisher soups、TIES、SafeMerge和MergeAlign更小的对齐子空间漂移和更少的预算违规。这些结果使保持对齐的合并成为一等设计目标,并为未来基础模型的几何感知组合指明了方向。

关键词

引用

@article{arxiv.2512.16245,
  title  = {AlignMerge - Alignment-Preserving Large Language Model Merging via Fisher-Guided Geometric Constraints},
  author = {Aniruddha Roy and Jyoti Patel and Aman Chadha and Vinija Jain and Amitava Das},
  journal= {arXiv preprint arXiv:2512.16245},
  year   = {2025}
}