使用 Rusty-DAWG 评估语言模型的 n-gram 新颖性
计算与语言
2025-08-26 v4 人工智能
摘要
我们如何评估语言模型 (LM) 生成文本相对于其训练语料库的新颖性?本工作调查现代 LM 是否从训练数据中生成 -gram,评估 (i) LM 分配给完整训练 -gram 的概率以及 (ii) -新颖性,即 LM 生成的 -gram 中未出现在训练数据中的比例(任意 的大小)。为实现与语料库规模无关的常数时间内任意长度 -gram 搜索,我们开发了受基因组数据索引启发的 Rusty-DAWG,这是一种新型搜索工具。我们比较 LM 生成文本与人类编写文本的新颖性,并探讨影响生成新颖性的因素,聚焦于 Pythia 模型。我们发现对于 ,LM 生成的文本不如人类编写文本新颖,但对于较小的 则更新颖。较大的 LM 和更受约束的解码策略都会降低新颖性。最后,我们表明 LM 若更频繁地完成训练中的 -gram,其损失更低。总体而言,我们的结果揭示了影响 LM 生成文本新颖性的因素,并发布 Rusty-DAWG 以便进一步研究预训练数据。
引用
@article{arxiv.2406.13069,
title = {Evaluating $n$-Gram Novelty of Language Models Using Rusty-DAWG},
author = {William Merrill and Noah A. Smith and Yanai Elazar},
journal= {arXiv preprint arXiv:2406.13069},
year = {2025}
}
备注
To appear at EMNLP 2024