预训练中的类别多样性之福
机器学习
2023-02-14 v3 机器学习
摘要
本文提出了一种新的统计分析,旨在解释近期自然语言处理(NLP)中预训练技术的优越成就。我们证明,当预训练任务的类别(例如掩码语言模型任务中的不同词)足够多样,即预训练最后线性层的最小奇异值(记为)较大时,预训练能显著提升下游任务的样本效率。特别地,我们表明迁移学习的超额风险享有的收敛速率,而标准监督学习为。此处,为预训练数据数量,为下游任务数据数量,且通常有。我们的证明依赖于用于拆解复合函数类的向量形式Rademacher复杂度链式法则以及一种修正的自协和条件。这些技术本身可具有独立意义。
引用
@article{arxiv.2209.03447,
title = {Blessing of Class Diversity in Pre-training},
author = {Yulai Zhao and Jianshu Chen and Simon S. Du},
journal= {arXiv preprint arXiv:2209.03447},
year = {2023}
}
备注
AISTATS 2023 (Oral)