中文

语言模型即超级马里奥:从同源模型中零成本吸收能力

计算与语言 2024-06-14 v3 机器学习

摘要

在本文中,我们揭示语言模型(LMs)可以通过吸收同源模型的参数而获得新能力,无需重新训练或使用GPU。我们首先引入DARE,将大多数delta参数(即微调参数与预训练参数之间的差异)置零而不影响监督微调(SFT)语言模型的能力,其以比例 pp 随机丢弃delta参数,并将剩余参数按 1/(1p)1 / (1 - p) 重新缩放以近似原始嵌入。随后,我们将DARE作为通用插件,对多个SFT同源模型的delta参数进行稀疏化,以缓解参数干扰,并通过参数融合将它们合并为单一模型。我们在基于编码器与解码器的语言模型上进行了实验,表明:(1)SFT delta参数值范围通常很小(在0.002以内)且具有极度冗余,DARE可轻松消除其中90%甚至99%的参数;(2)DARE可将多个任务特定的语言模型合并为一个具备多种能力的语言模型。值得注意的是,这一现象在大规模语言模型中更为显著,合并后的语言模型展现出超越任何源语言模型性能的潜力,提供了一项新发现。我们还利用DARE创建了一个合并语言模型,该模型在Open LLM Leaderboard上以70亿参数规模位列榜首。

关键词

引用

@article{arxiv.2311.03099,
  title  = {Language Models are Super Mario: Absorbing Abilities from Homologous Models as a Free Lunch},
  author = {Le Yu and Bowen Yu and Haiyang Yu and Fei Huang and Yongbin Li},
  journal= {arXiv preprint arXiv:2311.03099},
  year   = {2024}
}

备注

Accepted at ICML 2024