公式化法律语言信息检索中词汇模型与语义模型性能差距评估
计算与语言
2025-06-17 v1 信息检索
摘要
法律段落检索是一项重要任务,可协助法律从业者在耗时漫长的过程中查找相关先例以支持法律论证。本研究调查了从欧洲法院(CJEU)判决中检索法律段落或段落的任务,其语言高度结构化且公式化,导致重复模式。理解词汇模型或语义模型在处理法律语言重复性方面何时更有效,对于开发更准确、高效且透明的特定法律领域检索系统至关重要。为此,我们探讨了这种程序化的法律语言何时更适合使用依赖词汇和统计特征的方法(如 BM25),或用于捕获语义和上下文信息的密集检索模型。通过三种互补指标的定性和定量分析,我们表明在语言重复使用较多的场景中,词汇模型和密集模型均表现良好,而在重复和逐字引用较少且查询较长的情况下,BM25 优于密集模型。我们的实验还表明,BM25 是一个强有力的基线,在 7 项性能指标中有 4 项超越了现成的密集模型。然而,在领域特定数据上微调密集模型后性能得到提升,在大多数指标上超越了 BM25,我们分析了微调数据量对模型性能和时序鲁棒性的影响。与本工作相关的代码、数据集和附录可在以下网址获取:https://github.com/larimo/lexsem-legal-ir。
引用
@article{arxiv.2506.12895,
title = {Assessing the Performance Gap Between Lexical and Semantic Models for Information Retrieval With Formulaic Legal Language},
author = {Larissa Mori and Carlos Sousa de Oliveira and Yuehwern Yih and Mario Ventresca},
journal= {arXiv preprint arXiv:2506.12895},
year = {2025}
}