中文

预训练中的类别多样性之福

机器学习 2023-02-14 v3 机器学习

摘要

本文提出了一种新的统计分析,旨在解释近期自然语言处理(NLP)中预训练技术的优越成就。我们证明,当预训练任务的类别(例如掩码语言模型任务中的不同词)足够多样,即预训练最后线性层的最小奇异值(记为ν~\tilde{\nu})较大时,预训练能显著提升下游任务的样本效率。特别地,我们表明迁移学习的超额风险享有O(1ν~n)O\left(\frac{1}{\tilde{\nu} \sqrt{n}}\right)的收敛速率,而标准监督学习为O(1m)O\left(\frac{1}{\sqrt{m}}\right)。此处,nn为预训练数据数量,mm为下游任务数据数量,且通常有nmn \gg m。我们的证明依赖于用于拆解复合函数类的向量形式Rademacher复杂度链式法则以及一种修正的自协和条件。这些技术本身可具有独立意义。

关键词

引用

@article{arxiv.2209.03447,
  title  = {Blessing of Class Diversity in Pre-training},
  author = {Yulai Zhao and Jianshu Chen and Simon S. Du},
  journal= {arXiv preprint arXiv:2209.03447},
  year   = {2023}
}

备注

AISTATS 2023 (Oral)