Infini-gram mini: 基于 FM-Index 的互联网规模精确 n-gram 搜索
计算与语言
2026-01-07 v5
摘要
语言模型主要基于互联网上的海量文本数据进行训练,理解这一数据源变得日益重要。精确匹配搜索引擎能够在大规模文本语料库中进行搜索——统计字符串出现次数并检索包含该字符串的文档——但高昂的存储开销阻碍了其在互联网规模数据上的应用。我们提出了 infini-gram mini,一个高效且可扩展的系统,能够使拍字节级别的文本语料库变得可搜索。基于 FM-index 数据结构(Ferragina 和 Manzini, 2000),该结构同时索引并压缩文本,我们的系统创建的索引大小仅为语料库的 44%。Infini-gram mini 在索引速度(18 倍)和索引期间的内存使用(减少 3.2 倍)以及查询期间的内存使用(降至可忽略不计)方面大幅改进了现有的最佳 FM-index 实现。我们使用单个配备 128 个 vCPU 的 CPU 节点在 99 天内索引了 83TB 的互联网文本(若使用 137 个此类节点则仅需 19 小时)。我们展示了 infini-gram mini 在大规模基准污染分析中的一个重要用例。我们发现多个核心语言模型评估基准在互联网爬取数据中受到严重污染(GSM8K 中高达 74.2%),如果语言模型在这样的数据上进行训练,可能会导致对其能力的过高估计。我们主办了一个基准污染公告板,用于分享许多核心和社区贡献的基准的污染率。我们还发布了一个 Web 界面和一个 API 端点,用于对 infini-gram mini 索引提供通用搜索查询服务。
引用
@article{arxiv.2506.12229,
title = {Infini-gram mini: Exact n-gram Search at the Internet Scale with FM-Index},
author = {Hao Xu and Jiacheng Liu and Yejin Choi and Noah A. Smith and Hannaneh Hajishirzi},
journal= {arXiv preprint arXiv:2506.12229},
year = {2026}
}