当代文本分析任务中正则表达式索引的N-Gram选择策略评估(扩展版)
数据库
2025-09-08 v2
摘要
正则表达式(regex)的高效评估对文本分析至关重要,而n-gram索引是实现快速正则表达式评估性能的基础。然而,由于必须索引的可能n-gram数量呈指数级增长,这些索引面临可扩展性挑战。许多几十年前开发的现有选择策略未在当代大规模工作负载上进行过严格评估,且缺乏全面的性能比较。因此,需要一个统一且全面的评估框架,以便在相同的实验设置下比较这些方法。本文对三种具有代表性的n-gram选择策略在五种工作负载(包括实时生产日志和基因组序列分析)上进行了首次系统评估。我们考察了它们在索引构建时间、存储开销、误报率和端到端查询性能方面的权衡。通过实证结果,本研究为现有的基于n-gram的正则表达式评估方法提供了现代视角,以及广泛的观察、有价值的发现和一个可适应的测试框架,以指导该领域的未来研究。我们在 https://github.com/mush-zhang/RegexIndexComparison 上开源了这些方法的实现和我们的测试框架。
关键词
引用
@article{arxiv.2504.12251,
title = {An Evaluation of N-Gram Selection Strategies for Regular Expression Indexing in Contemporary Text Analysis Tasks. Extended Version},
author = {Ling Zhang and Shaleen Deep and Jignesh M. Patel and Karthikeyan Sankaralingam},
journal= {arXiv preprint arXiv:2504.12251},
year = {2025}
}