LM-Cocktail:通过模型合并实现语言模型的弹性调优
计算与语言
2023-12-11 v4 人工智能
信息检索
摘要
预训练语言模型被持续微调以更好地支持下游应用。然而,该操作可能导致在目标领域之外的一般任务上出现显著的性能退化。为克服此问题,我们提出LM-Cocktail,使微调模型在通用视角下保持弹性。我们的方法以模型合并的形式进行,其中微调语言模型通过加权平均与预训练基模型或其他领域的同侪模型合并。尽管简单,LM-Cocktail却出奇地有效:所得模型能够在整个通用任务范围内取得强劲的经验性能,同时在其目标领域保持优越能力。我们使用LLama和BGE模型在包括FLAN、MMLU、MTEB在内的流行基准上进行了全面实验,结果验证了我们所提方法的有效性。代码与检查点可在 https://github.com/FlagOpen/FlagEmbedding/tree/master/LM_Cocktail 获取。
引用
@article{arxiv.2311.13534,
title = {LM-Cocktail: Resilient Tuning of Language Models via Model Merging},
author = {Shitao Xiao and Zheng Liu and Peitian Zhang and Xingrun Xing},
journal= {arXiv preprint arXiv:2311.13534},
year = {2023}
}
备注
Work is in progress