中文

使用 Rusty-DAWG 评估语言模型的 n-gram 新颖性

计算与语言 2025-08-26 v4 人工智能

摘要

我们如何评估语言模型 (LM) 生成文本相对于其训练语料库的新颖性?本工作调查现代 LM 是否从训练数据中生成 nn-gram,评估 (i) LM 分配给完整训练 nn-gram 的概率以及 (ii) nn-新颖性,即 LM 生成的 nn-gram 中未出现在训练数据中的比例(任意 nn 的大小)。为实现与语料库规模无关的常数时间内任意长度 nn-gram 搜索,我们开发了受基因组数据索引启发的 Rusty-DAWG,这是一种新型搜索工具。我们比较 LM 生成文本与人类编写文本的新颖性,并探讨影响生成新颖性的因素,聚焦于 Pythia 模型。我们发现对于 n>4n > 4,LM 生成的文本不如人类编写文本新颖,但对于较小的 nn 则更新颖。较大的 LM 和更受约束的解码策略都会降低新颖性。最后,我们表明 LM 若更频繁地完成训练中的 nn-gram,其损失更低。总体而言,我们的结果揭示了影响 LM 生成文本新颖性的因素,并发布 Rusty-DAWG 以便进一步研究预训练数据。

关键词

引用

@article{arxiv.2406.13069,
  title  = {Evaluating $n$-Gram Novelty of Language Models Using Rusty-DAWG},
  author = {William Merrill and Noah A. Smith and Yanai Elazar},
  journal= {arXiv preprint arXiv:2406.13069},
  year   = {2025}
}

备注

To appear at EMNLP 2024