Better Call CLAUSE:审计 LLM 法律推理能力的偏差基准
人工智能
2026-01-08 v2
摘要
大型语言模型(LLMs)快速融入高风险法律领域,暴露出一个关键缺口:目前没有基准能够系统性地对其可靠性进行压力测试,以应对现实合同中所蕴含的细微、对抗性且常常隐含的缺陷。为此,我们引入 CLAUSE,一个首创的基准,旨在评估 LLM 法律推理的脆弱性。我们研究 LLM 检测和推理细粒度偏差的能力,通过产生超过 7500 个被扰动的真实世界合同(源自 CUAD 和 ContractNLI 等基础数据集)。我们的新颖、基于角色的管道生成 10 种不同的异常类别,然后通过检索增强生成(RAG)系统对其进行验证,以确保法律忠诚度。我们使用 CLAUSE 评估领先 LLM 检测嵌入式法律缺陷并解释其重要性的能力。我们的分析显示,一个关键弱点:这些模型常常忽略细微的错误,更难以对其进行合法的解释。我们的工作为识别和纠正此类推理失败的法律 AI 指明了方向。
引用
@article{arxiv.2511.00340,
title = {Better Call CLAUSE: A Discrepancy Benchmark for Auditing LLMs Legal Reasoning Capabilities},
author = {Manan Roy Choudhury and Adithya Chandramouli and Mannan Anand and Vivek Gupta},
journal= {arXiv preprint arXiv:2511.00340},
year = {2026}
}
备注
42 pages, 4 images