预训练模型的排序与调优:利用模型中心的新范式
机器学习
2022-07-15 v4
摘要
带有许多预训练模型(PTM)的模型中心已成为深度学习的基石。尽管以高昂代价构建,它们仍未被充分利用——从业者通常按流行度从提供的模型中心选取一个PTM,然后微调该PTM以解决目标任务。这种朴素但常见的做法对预训练模型中心的充分利用造成了两个障碍:首先,按流行度选择PTM无法保证最优性;其次,仅使用了一个PTM而忽略了其余PTM。另一种可能是考虑PTM的所有可能组合并广泛微调每个组合,但这不仅计算上难以承受,还可能导致统计过拟合。在本文中,我们提出了一种利用模型中心的新范式,介于上述两个极端之间。该范式由两个方面的特征刻画:(1)我们使用证据最大化过程来估计由预训练模型提取特征给定的标签证据最大值。该过程可在微调前对各种类型PTM和任务对模型中心内所有PTM排序。(2)若我们对模型架构无偏好,排名最佳的PTM可被微调并部署;或者,可通过我们提出的贝叶斯过程由排名前的PTM调优目标PTM。我们将此过程称为\emph{B-Tuning},它不仅优于为调优同构PTM设计的专门方法,也适用于调优异构PTM这一挑战性问题,并达到了新的基准性能水平。
引用
@article{arxiv.2110.10545,
title = {Ranking and Tuning Pre-trained Models: A New Paradigm for Exploiting Model Hubs},
author = {Kaichao You and Yong Liu and Ziyang Zhang and Jianmin Wang and Michael I. Jordan and Mingsheng Long},
journal= {arXiv preprint arXiv:2110.10545},
year = {2022}
}
备注
47 pages, camera-ready version for JMLR 2022