中文

通过部分打乱训练数据改进语言模型

计算与语言 2019-03-13 v2

摘要

尽管SGD要求在每个训练轮次之间打乱训练数据,目前尚无任何词级语言建模系统这样做。若朴素地打乱训练数据中的所有句子,模型将无法学习句间依赖关系。本文提出一种在轮次间部分打乱训练数据的方法。该方法使每个批次具有随机性,同时保留大部分句子顺序。它在Penn Treebank与WikiText-2数据集上的词级语言建模任务中取得了新的SOTA结果。

关键词

引用

@article{arxiv.1903.04167,
  title  = {Partially Shuffling the Training Data to Improve Language Models},
  author = {Ofir Press},
  journal= {arXiv preprint arXiv:1903.04167},
  year   = {2019}
}