中文

面向万亿级语料库的快速软模式匹配器 SoftMatcha 2

计算与语言 2026-02-12 v1 机器学习 机器学习

摘要

我们提出一种超高速且灵活的搜索算法,使其能够在 0.3 秒内处理万亿规模的自然语言语料库中的搜索,同时处理语义变体(替换、插入和删除)。我们的算法基于后缀数组实现的字符串匹配,能够随语料库规模而扩展。在查询语义松弛导致的组合爆炸问题上,我们的方法基于两个关键算法思想:基于磁盘的快速精确查找,以及动态语料库感知剪枝。我们理论上表明,所提方法通过利用自然语言的统计特性,抑制了随查询长度增长的指数级搜索空间。在 FineWeb-Edu (Lozhkov 等, 2024) (1.4T tokens) 上的实验中,我们表明该方法在搜索延迟方面显著低于现有方法:infini-gram (Liu 等, 2024)、infini-gram mini (Xu 等, 2025) 和 SoftMatcha (Deguchi 等, 2025)。作为实际应用,我们演示该方法识别了现有方法未能识别的训练语料库中的基准数据污染问题。我们还提供了跨七种语言语料库的快速软搜索在线演示。

关键词

引用

@article{arxiv.2602.10908,
  title  = {SoftMatcha 2: A Fast and Soft Pattern Matcher for Trillion-Scale Corpora},
  author = {Masataka Yoneda and Yusuke Matsushita and Go Kamoda and Kohei Suenaga and Takuya Akiba and Masaki Waga and Sho Yokoi},
  journal= {arXiv preprint arXiv:2602.10908},
  year   = {2026}
}

备注

Project Page & Web Interface: https://softmatcha.github.io/v2/, Source Code: https://github.com/softmatcha/softmatcha2