中文

Legal-DC:面向法律文档的检索增强生成基准

计算与语言 2026-03-13 v1

摘要

检索增强生成(RAG)已成为法律文档咨询的有前景技术,但其在中文法律场景中的应用面临两个关键局限:现有基准缺乏对联合检索-生成评估的专业支持,主流 RAG 系统往往难以适应法律条款的结构化特性。为此,本研究提出两大核心贡献:其一,我们构建了 Legal-DC 基准数据集,包含 480 份法律文档(涵盖市场监管、合同管理等领域)及 2,475 组精炼问答对,每组问答均标注了条款级参考文献,填补了中文法律 RAG 专业评估资源的空白。其二,我们提出 LegRAG 框架,集成法律适应性索引(条款边界分段)与双路径自反思机制,以确保条款完整性并提升答案准确性。第三,我们引入大语言模型的自动评估方法,以满足法律检索场景的高可靠性需求。LegRAG 在关键评估指标上均显著优于现有最先进方法,提升幅度为 1.3%至 5.6%。本研究提供了面向中文法律 RAG 系统的专业化基准、实用框架及实证洞见。我们的代码与数据已公开于 https://github.com/legal-dc/Legal-DC。

关键词

引用

@article{arxiv.2603.11772,
  title  = {Legal-DC: Benchmarking Retrieval-Augmented Generation for Legal Documents},
  author = {Yaocong Li and Qiang Lan and Leihan Zhang and Le Zhang},
  journal= {arXiv preprint arXiv:2603.11772},
  year   = {2026}
}

备注

20 pages, 4 figures, to be submitted to a conference/journal