面向法律领域的细粒度主张级检验-生成基准
计算与语言
2026-05-25 v3 人工智能
摘要
大型语言模型(LLM)的快速发展正在将语义搜索从检索-生成范式转向问答范式,用户提出问题,LLM生成回答。在高风险领域如法律领域,检索增强生成(RAG)常用于缓解生成回答中的幻觉问题。然而,既有工作表明,无论是通用型还是法律专用型RAG系统,都以不同程度的幻觉率存在问题,这使得细粒度评估变得必不可少。尽管存在这种需求,但现有的法律RAG系统评估框架缺乏对检索与生成性能分别进行详细分析所需的细粒度。此外,当前基准主要是英文版的,且以法律专家查询为中心,忽略了非专家需求。我们引入ClaimRAG-LAW,这是一个支持法语和英文的法律RAG综合数据集,面向专家和非专家,包含反映真实场景的多样化问题类型。我们进一步对领先的法律RAG系统进行细粒度评估,揭示了法律领域在检索、生成和主张级分析方面的局限性。
关键词
引用
@article{arxiv.2605.21071,
title = {Fine-grained Claim-level RAG Benchmark for Law},
author = {Souvick Das and Sallam Abualhaija and Domenico Bianculli},
journal= {arXiv preprint arXiv:2605.21071},
year = {2026}
}