XFT:通过简单合并升级的混合专家模型释放代码指令微调的潜力
计算与语言
2024-06-10 v2 人工智能
机器学习
软件工程
摘要
我们提出了 XFT,一种简单而强大的训练方案,通过简单合并升级的混合专家模型来释放指令微调代码大语言模型(LLM)的性能极限。虽然普通的稀疏升级未能改进指令微调,但 XFT 在稀疏升级中引入了共享专家机制和一种新颖的路由权重归一化策略,显著提升了指令微调。在对升级的 MoE 模型进行微调后,XFT 引入了一种可学习的模型合并机制,将升级的 MoE 模型编译回稠密模型,仅以稠密模型的计算代价实现了升级 MoE 级别的性能。通过将 XFT 应用于 1.3B 模型,我们创建了一个新的 SOTA 微型代码 LLM(<3B),在 HumanEval 和 HumanEval+ 上分别达到 67.1 和 64.6 的 pass@1。在相同数据和模型架构下,XFT 在 HumanEval+ 上将监督微调(SFT)提升了 13%,并在 MBPP+、MultiPL-E 和 DS-1000 上实现了 2% 到 13% 的一致提升,证明了其泛化能力。XFT 与 Evol-Instruct 和 OSS-Instruct 等现有技术完全正交,为改进代码指令微调开辟了新的维度。代码可在 https://github.com/ise-uiuc/xft 获取。
引用
@article{arxiv.2404.15247,
title = {XFT: Unlocking the Power of Code Instruction Tuning by Simply Merging Upcycled Mixture-of-Experts},
author = {Yifeng Ding and Jiawei Liu and Yuxiang Wei and Terry Yue Zhuo and Lingming Zhang},
journal= {arXiv preprint arXiv:2404.15247},
year = {2024}
}