知识在微调语言模型的权重空间中是一个区域
机器学习
2023-10-16 v3 人工智能
计算与语言
摘要
神经网络的研究一直聚焦于理解在单一数据集上训练的单一模型。然而,关于不同模型之间关系(尤其是那些在不同数据集上训练或测试的模型)所知相对较少。我们通过研究不同模型的权重空间与底层损失景观如何相互关联来解决这一问题。具体而言,我们证明经过优化以获得高性能的微调模型位于权重空间中定义良好的区域内,反之亦然——任何位于这些区域中的模型同样表现出高性能。值得注意的是,我们表明在同一数据集上微调的语言模型在权重空间中形成紧密簇,而在同一底层任务的不同数据集上微调的模型形成较松散的簇。此外,在模型之间的区域周围遍历会得到新模型,其性能可与通过微调获得的模型相媲美甚至更优,即使在原始模型未微调的任务上也是如此。我们的发现增进了对模型间关系的理解,表明位于两个相似模型之间的模型可以习得两者的知识。我们利用这一点设计了一种用于选择更优模型以进行高效微调的方法。具体而言,我们表明在12个数据集中有11个,从区域中心出发与使用预训练模型同样有效(甚至更优),平均准确率提升3.06。
引用
@article{arxiv.2302.04863,
title = {Knowledge is a Region in Weight Space for Fine-tuned Language Models},
author = {Almog Gueta and Elad Venezian and Colin Raffel and Noam Slonim and Yoav Katz and Leshem Choshen},
journal= {arXiv preprint arXiv:2302.04863},
year = {2023}
}