Mashup 学习:通过混搭过去的检查点实现更快的微调
机器学习
2026-03-12 v1 人工智能
摘要
在领域特定数据上进行微调是提高大语言模型在下游任务性能的既定方法。训练每个数据集会产生新的模型权重,在机构内部或开源平台上保存大量检查点。然而,这些训练制品鲜有被重用于以适应潜在相似任务,尽管它们包含了改进的模型能力。本文提出 Mashup 学习,一种简单方法,利用先前训练运行的输出来增强模型对新任务的适应性。我们的程序识别目标数据集最相关的历史检查点,通过模型合并方式聚合这些检查点,并将结果作为训练的改进初始化。我们在 8 项标准 LLM 基准测试中、四个模型和两个来源检查点集合上进行测试,Mashup 学习在下游准确率上始终比从头训练提高 0.5-5 个百分点。它还加快了收敛速度,在包括所有选择和合并开销后,需要 41-46% 更少的训练步数,最多可缩短 37% 的总体运行时间,以匹配从头训练的准确率。
引用
@article{arxiv.2603.10156,
title = {Mashup Learning: Faster Finetuning by Remixing Past Checkpoints},
author = {Sofia Maria Lo Cicero Vaina and Artem Chumachenko and Max Ryabinin},
journal= {arXiv preprint arXiv:2603.10156},
year = {2026}
}
备注
18 pages, 7 figures. Code: https://github.com/2son1a/mashup-learning