中文

LEVI:通过不同视图的逐层集成实现泛化微调

机器学习 2024-06-21 v2 人工智能

摘要

微调正被广泛用于在新的下游任务中利用预训练基础模型的能力。尽管微调在各种任务上取得了许多成功,但最近的研究观察到微调模型在未见分布(即分布外,OOD)上的泛化面临挑战。为了提高 OOD 泛化能力,先前的一些研究识别了微调数据的局限性,并对微调进行正则化以保留从预训练数据中学到的一般表示。然而,预训练数据和模型中潜在的局限性往往被忽视。在本文中,我们认为过度依赖预训练表示可能会阻碍微调学习下游任务所需的核心表示,从而损害其 OOD 泛化能力。当新任务与预训练数据来自不同(子)领域时,这尤为灾难性。为了解决预训练数据和微调数据中的问题,我们提出了一种新颖的泛化微调方法 LEVI(不同视图的逐层集成,Layer-wise Ensemble of different VIews),其中预训练模型在保持效率的同时,与一个小型任务特定模型进行逐层自适应集成。通过结合两个互补模型,LEVI 有效地抑制了微调数据和预训练模型中存在问题的特征,并保留了新任务所需的有用特征。在大型语言和视觉模型上的广泛实验表明,LEVI 通过强调来自微调数据和预训练特征的不同视图,极大地提高了微调的泛化能力。

关键词

引用

@article{arxiv.2402.04644,
  title  = {LEVI: Generalizable Fine-tuning via Layer-wise Ensemble of Different Views},
  author = {Yuji Roh and Qingyun Liu and Huan Gui and Zhe Yuan and Yujin Tang and Steven Euijong Whang and Liang Liu and Shuchao Bi and Lichan Hong and Ed H. Chi and Zhe Zhao},
  journal= {arXiv preprint arXiv:2402.04644},
  year   = {2024}
}

备注

In Proceedings of the 41st International Conference on Machine Learning (ICML), 2024