面向大规模检索的精准法律句子边界检测:NUPunkt 与 CharBoundary
计算与语言
2025-04-08 v1
摘要
我们提出了 NUPunkt 和 CharBoundary 两个句子边界检测库,针对高精度、高吞吐量的法律文本大规模处理(如尽职调查、e-discovery 和法律研究)进行了优化。这两个库解决了法律文档包含特殊引用、缩写和复杂句式的关键难题,这些因素会干扰通用句子边界检测器。我们的实验评估在五个多样化法律数据集上进行,包含超过25,000个文档和197,000个已标注的句子边界。结果显示,NUPunkt 在达到91.1%精度的同时,能够以每秒1000万字符的速度处理,内存需求适中(432 MB)。CharBoundary 模型提供了精度-召回率之间的平衡与可调 tradeoff,其中大型模型在所有测试方法中取得了最高的 F1 分数(0.782)。值得注意的是,NUPunkt 在精度上比通用工具提高了29%-32%,同时保持了卓越的吞吐量,能够在数分钟内处理数百万文档,而非数小时。两个库都能在标准 CPU 硬件上高效运行,无需专业加速器。NUPunkt 采用纯 Python 实现,无外部依赖;CharBoundary 仅依赖 scikit-learn,可选用 ONNX runtime 实现优化。两个库均采用 MIT 许可证,可通过 PyPI 安装,并可在 https://sentences.aleainstitute.ai/ 上进行交互式测试。这些库通过保持法律概念在句子之间的连贯性,解决了检索增强生成系统中的关键精度问题;每个精度提升比例都会在上下文碎片化方面产生指数级的减少,进而在检索管道中产生叠加效应,显著提升下游推理质量。
关键词
引用
@article{arxiv.2504.04131,
title = {Precise Legal Sentence Boundary Detection for Retrieval at Scale: NUPunkt and CharBoundary},
author = {Michael J Bommarito and Daniel Martin Katz and Jillian Bommarito},
journal= {arXiv preprint arXiv:2504.04131},
year = {2025}
}
备注
12 pages, 5 figures, 6 tables