中文

Infini-gram:将无上限 n-gram 语言模型扩展至万亿级标记

计算与语言 2025-04-08 v4 人工智能 信息检索

摘要

在大型语言模型(LLM)时代,n-gram 语言模型是否仍然相关?我们的答案是肯定的,我们在文本分析和改进神经网络 LLM 方面展示了其价值。这通过两个方面的现代化来实现。首先,我们以与神经网络 LLM 相同的规模进行训练——5 万亿标记。这就是构建的规模最大的 n-gram LM。其次,现有的 n-gram LM 使用较小的 n 值,这会限制其性能;我们引入一种带回退的 ∞-gram LM,允许 n 值任意增大。由于预计算 n-gram 计数表会非常昂贵,因此我们开发了一个基于后缀数组的引擎——infini-gram——能够以毫秒级延迟计算 ∞-gram(以及任意 n 的 n-gram)概率。∞-gram 框架和 infini-gram 引擎使我们能够对人类撰写和机器生成的文本进行许多新颖有趣的分析:我们发现 ∞-gram LM 在下一个标记预测中具有相当高的准确率(47%),并且可以补充神经网络 LLM 以大幅降低其困惑度。当分析机器生成文本时,我们还观察到机器与 ∞-gram 一致性随后缀长度而变化,这表明神经网络 LLM 的预训练和 Transformer 的位置编码存在不足。

关键词

引用

@article{arxiv.2401.17377,
  title  = {Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens},
  author = {Jiacheng Liu and Sewon Min and Luke Zettlemoyer and Yejin Choi and Hannaneh Hajishirzi},
  journal= {arXiv preprint arXiv:2401.17377},
  year   = {2025}
}

备注

Published at COLM 2024, spotlight paper