中文

LegalCiteBench:评估法律语言模型的引文可靠性

计算与语言 2026-05-12 v1 人工智能

摘要

大语言模型(LLM)正日益整合到法律起草与研究工作流中,其中错误的引文或捏造的判例可能导致严重的职业损害。现有的法律基准主要强调法定推理、合同理解或一般法律问答,但并未直接研究普通法的一个核心失效模式:当被要求在没有外部依据的情况下提供案件权威依据时,模型可能返回看似合理但错误的引文或案件。我们引入了 LegalCiteBench,一个用于研究法律语言模型在闭卷设定下的引文恢复、引文验证和案件匹配的基准。LegalCiteBench 包含约 24K 个评估实例,由 Case Law Access Project 的 1,000 份真实美国司法意见书构建而成。该基准涵盖五个以引文为中心的任务:引文检索、引文补全、引文错误检测、案件匹配以及案件验证与纠正。在 21 个 LLM 中,在这种闭卷设定下精确的引文恢复仍然极具挑战性:即使是最强的模型在引文检索和补全上的得分也低于 7/100。在所评估的模型中,规模和法律领域预训练提供的增益有限,且无法解决这一困难。在我们的评估协议下,模型也经常提供具体但错误或重叠度低的权威依据,在 21 个评估模型中有 20 个在侧重检索的任务上误导性答案率(MAR)超过 94%。仅提示弃权实验表明,明确的不确定性指令减少了一些自信的捏造,但并未提高引文的正确性。LegalCiteBench 旨在作为一个诊断框架,用于研究在外部依据缺失、不完整或被绕过时的权威依据生成失败、验证行为和弃权问题。

关键词

引用

@article{arxiv.2605.10186,
  title  = {LegalCiteBench: Evaluating Citation Reliability in Legal Language Models},
  author = {Sijia Chen and Hang Yin and Shunfan Zhou},
  journal= {arXiv preprint arXiv:2605.10186},
  year   = {2026}
}

备注

Preprint. 23 pages including references and appendices