利用参数空间对称性实现 LLM 中的推理技能迁移
计算与语言
2025-11-17 v1 人工智能
机器学习
摘要
任务算术是一种强大的在大型语言模型 (LLMs) 之间传递技能的技术,但常因模型在训练期间发生偏移而产生负面干扰。我们通过首先对齐模型的参数空间,利用 Transformer 架构固有的置换、旋转和缩放对称性来解决此限制。我们为现代分组查询注意力 (GQA) 和 SwiGLU 层适配参数空间对齐,探索了基于权重和基于激活的方法。通过这种以对齐为先的策略,我们成功地将高级推理技能传递给非推理模型。在具有挑战性推理基准测试上进行实验,显示我们的方法在标准任务算术方面 consistently 优于后者。这项工作提供了一种有效的方法,用于合并和传递跨越演化的 LLM 家族中的专用技能,减少冗余微调,提高模型的可适应性。
关键词
引用
@article{arxiv.2511.10850,
title = {Leveraging Parameter Space Symmetries for Reasoning Skill Transfer in LLMs},
author = {Stefan Horoi and Sangwoo Cho and Supriyo Chakraborty and Shi-Xiong Zhang and Sambit Sahu and Guy Wolf and Genta Indra Winata},
journal= {arXiv preprint arXiv:2511.10850},
year = {2025}
}