通过部分打乱训练数据改进语言模型
计算与语言
2019-03-13 v2
摘要
尽管SGD要求在每个训练轮次之间打乱训练数据,目前尚无任何词级语言建模系统这样做。若朴素地打乱训练数据中的所有句子,模型将无法学习句间依赖关系。本文提出一种在轮次间部分打乱训练数据的方法。该方法使每个批次具有随机性,同时保留大部分句子顺序。它在Penn Treebank与WikiText-2数据集上的词级语言建模任务中取得了新的SOTA结果。
引用
@article{arxiv.1903.04167,
title = {Partially Shuffling the Training Data to Improve Language Models},
author = {Ofir Press},
journal= {arXiv preprint arXiv:1903.04167},
year = {2019}
}