中文

关于预训练数据量对紧凑语言模型的重要性

计算与语言 2020-10-12 v2 机器学习

摘要

语言建模的最新进展导致了计算密集且资源需求巨大的最先进(SOTA)模型。为推进可持续实践,我们研究了预训练数据量对紧凑语言模型的影响。多个基于 BERT 的模型在逐渐增加的法语文本量上训练。通过在 French Question Answering Dataset (FQuAD) 上微调,我们观察到仅用少至 100 MB 文本即可获得表现良好的模型。此外,我们表明在预训练数据量低于临界值之后,在任务特定语料上的中间预训练步骤不会带来实质性改进。

关键词

引用

@article{arxiv.2010.03813,
  title  = {On the importance of pre-training data volume for compact language models},
  author = {Vincent Micheli and Martin d'Hoffschmidt and François Fleuret},
  journal= {arXiv preprint arXiv:2010.03813},
  year   = {2020}
}

备注

EMNLP 2020; typo corrected