中文

语言模型从其训练数据中复制了多少?使用RAVEN评估文本生成中的语言新颖性

计算与语言 2021-11-19 v1

摘要

当前的语言模型可以生成高质量文本。它们只是在复制以前见过的文本,还是已经学习了可泛化的语言抽象?为了梳理这些可能性,我们引入了RAVEN,一套用于评估生成文本新颖性的分析工具,聚焦于序列结构(n-gram)和句法结构。我们将这些分析应用于四个神经语言模型(一个LSTM、一个Transformer、Transformer-XL和GPT-2)。对于局部结构——例如个别依存关系——模型生成的文本比我们基于各模型测试集上人类生成文本的基线显著缺乏新颖性。对于更大规模的结构——例如整体句子结构——模型生成的文本与人工生成基线一样新颖甚至更新颖,但模型仍有时会大量复制,在某些情况下从训练集中重复超过1,000词长的段落。我们还进行了广泛的手动分析,表明GPT-2的新颖文本通常在形态和句法上结构良好,但存在相当频繁的语义问题(例如自相矛盾)。

关键词

引用

@article{arxiv.2111.09509,
  title  = {How much do language models copy from their training data? Evaluating linguistic novelty in text generation using RAVEN},
  author = {R. Thomas McCoy and Paul Smolensky and Tal Linzen and Jianfeng Gao and Asli Celikyilmaz},
  journal= {arXiv preprint arXiv:2111.09509},
  year   = {2021}
}

备注

10 pages, plus 39 pages of appendices