中文

语言模型填充中间文本的高效训练

计算与语言 2022-07-29 v1

摘要

我们表明,在对数据集施加一种简单的变换(即将文档中间的一段文本移到其末尾)后,自回归语言模型能够学习填充文本。尽管这种数据增强近年来备受关注,我们提供了大量证据,表明以这种方式变换较大比例数据来训练模型并不会损害原有的从左至右生成能力(通过广泛尺度下的困惑度与采样评估衡量)。鉴于训练填充中间(fill-in-the-middle, FIM)模型的实用性、简单性与高效性,我们建议未来的自回归语言模型默认使用FIM训练。为此,我们对关键超参数进行了一系列消融实验,如数据变换频率、变换结构以及填充段的选取方法。我们利用这些消融实验给出了训练FIM模型的强默认设置与最佳实践。我们已在API中发布了依据最佳实践训练的最优填充模型,并发布填充基准以促进未来研究。

关键词

引用

@article{arxiv.2207.14255,
  title  = {Efficient Training of Language Models to Fill in the Middle},
  author = {Mohammad Bavarian and Heewoo Jun and Nikolas Tezak and John Schulman and Christine McLeavey and Jerry Tworek and Mark Chen},
  journal= {arXiv preprint arXiv:2207.14255},
  year   = {2022}
}