融合微调模型以获得更好的预训练
计算与语言
2022-04-08 v1 计算机视觉与模式识别
机器学习
摘要
预训练模型是训练的标准起点。该方法始终优于随机初始化。然而,预训练是一项昂贵的工程,很少有人能够承担。在本文中,我们以极低的成本通过融合多个现有微调模型为一个来创建更好的基础模型。具体而言,我们通过平均这些模型的权重进行融合。我们表明,融合模型的结果优于预训练模型的结果。我们还表明,融合通常优于 intertraining。我们发现融合对目标任务的依赖较小。此外,权重衰减会消除 intertraining 的效果,但不会影响融合的效果。
引用
@article{arxiv.2204.03044,
title = {Fusing finetuned models for better pretraining},
author = {Leshem Choshen and Elad Venezian and Noam Slonim and Yoav Katz},
journal= {arXiv preprint arXiv:2204.03044},
year = {2022}
}