Param$\Delta$:用于直接权重混合的零成本后训练大语言模型方法
计算与语言
2026-03-04 v1 人工智能
机器学习
摘要
大型语言模型的后训练阶段对于提升指令遵循、推理和人类偏好对齐等能力至关重要。然而,后训练需要大量高质量数据,易产生过拟合风险,同时因每次基模型更新后需重复后训练和评估,计算成本高昂。本文引入Param一种新方法,通过将现有后训练模型的知识传递给新更新的基模型,实现零额外训练的后训练。具体做法是计算后训练模型权重与基模型权重之差,并加至更新后的基模型,定义Param模型为:。该方法竟为新基模型赋予后训练能力,性能接近直接后训练。我们对LLama3、Llama3.1、Qwen和DeepSeek-distilled模型进行分析。结果表明,Param模型有效复制了传统后训练。例如,由70B Llama3-inst、Llama3-base、Llama3.1-base模型获得的Param模型在平均性能上约达到Llama3.1-inst模型的95%。Param为开源社区中利用基模型和指令模型checkpoint(常更新)的开发者提供了一种零成本框架,加速模型迭代开发周期。
引用
@article{arxiv.2504.21023,
title = {Param$\Delta$ for Direct Weight Mixing: Post-Train Large Language Model at Zero Cost},
author = {Sheng Cao and Mingrui Wu and Karthik Prasad and Yuandong Tian and Zechun Liu},
journal= {arXiv preprint arXiv:2504.21023},
year = {2026}
}
备注
Published as a conference paper at ICLR 2025