关于无监督预训练的泛化能力
机器学习
2024-03-12 v1 机器学习
摘要
无监督学习的最新进展表明,无监督预训练后接微调可以提高模型泛化能力。然而,目前缺乏对在无标签数据集上学习到的表示函数如何影响微调模型泛化能力的严格理解。现有的理论研究未能充分解释预训练和微调阶段中分布和任务的异质性。为了弥补这一差距,本文引入了一个新的理论框架,阐明了影响无监督预训练期间获得的知识向后续微调阶段迁移的关键因素,进而影响微调模型在下游任务上的泛化能力。我们将该理论框架应用于分析两种不同场景的泛化界:基于深度神经网络的 Context Encoder 预训练和基于深度 Transformer 的 Masked Autoencoder 预训练,随后在二分类任务上进行微调。最后,受我们的发现启发,我们提出了一种在预训练期间的新颖正则化方法,以进一步增强微调模型的泛化能力。总体而言,我们的结果有助于更好地理解无监督预训练和微调范式,并能为设计更有效的预训练算法提供启示。
引用
@article{arxiv.2403.06871,
title = {On the Generalization Ability of Unsupervised Pretraining},
author = {Yuyang Deng and Junyuan Hong and Jiayu Zhou and Mehrdad Mahdavi},
journal= {arXiv preprint arXiv:2403.06871},
year = {2024}
}