中文

何时需要数十亿词的预训练数据?

计算与语言 2020-11-11 v1

摘要

NLP 目前由像 RoBERTa 这样的通用预训练语言模型主导,它们通过在数十亿词上进行预训练,在 NLU 任务上取得强劲性能。但是,Transformer 语言模型从大规模预训练中学到了哪些无法从更少数据中获得的确切知识或技能?我们采用四种探测方法——分类器探测、信息论探测、无监督相对可接受性判断以及在 NLU 任务上的微调——并绘制学习曲线,利用 MiniBERTas(一组在 1M、10M、100M 和 1B 词上预训练的 RoBERTa 模型)追踪这些不同语言能力度量随预训练数据量的增长情况。我们发现,语言模型仅需约 10M 或 100M 词即可学习到可靠编码我们所测试的大部分句法和语义特征的表示。而要获得足以掌握典型下游 NLU 任务所需的常识知识和其他技能,则需要大得多的数据量。结果表明,尽管编码语言特征的能力几乎肯定是语言理解的必要条件,但其他形式的知识很可能是大型预训练模型近期语言理解能力提升的主要驱动力。

关键词

引用

@article{arxiv.2011.04946,
  title  = {When Do You Need Billions of Words of Pretraining Data?},
  author = {Yian Zhang and Alex Warstadt and Haau-Sing Li and Samuel R. Bowman},
  journal= {arXiv preprint arXiv:2011.04946},
  year   = {2020}
}

备注

10 pages, 6 figures