面向大规模法律数据集RAG系统可靠检索的探索
计算与语言
2025-10-09 v1 信息检索
摘要
检索增强生成(RAG)是缓解大语言模型(LLM)在法律应用中幻觉现象的有前景方法,但其可靠性严重依赖于检索步骤的准确性。这在法律领域尤其具有挑战性,因为结构相似文档的大型数据库常导致检索系统失效。本文通过首先识别并量化一种关键的失效模式——文档级检索不匹配(DRM),即检索器从完全错误的源文档中选择信息,来应对这一挑战。为缓解DRM,我们研究了一种简单且计算高效的技术,称为摘要增强分块(SAC)。该方法通过文档级合成摘要增强每个文本块,从而注入在标准分块过程中否则会丢失的关键全局上下文。我们在多样化的法律信息检索任务上的实验表明,SAC显著减少了DRM,进而也提升了文本级检索的精确率和召回率。有趣的是,我们发现通用摘要策略优于结合法律专家领域知识来针对特定法律元素的方法。我们的工作提供了证据,表明这种实用、可扩展且易于集成的技术能够提升RAG系统在应用于大规模法律文档数据集时的可靠性。
引用
@article{arxiv.2510.06999,
title = {Towards Reliable Retrieval in RAG Systems for Large Legal Datasets},
author = {Markus Reuter and Tobias Lingenberg and Rūta Liepiņa and Francesca Lagioia and Marco Lippi and Giovanni Sartor and Andrea Passerini and Burcu Sayin},
journal= {arXiv preprint arXiv:2510.06999},
year = {2025}
}
备注
Accepted for the 7th Natural Legal Language Processing Workshop (NLLP 2025), co-located with EMNLP 2025