ContractEval:面向商业合同条款级法律风险识别的 LLM 基准测试
人工智能
2025-08-06 v1
摘要
大型语言模型(LLMs)在专业领域如法律风险分析中的潜力尚未得到充分探索。针对日益增长的本地化部署开源 LLMs 以保护数据保密的需求,本文引入 ContractEval——首个全面评估开源 LLMs 是否能匹配专有 LLMs 在商业合同条款级法律风险识别能力的基准测试。采用 Contract Understanding Atticus Dataset(CUAD),我们评估了 4 个专有模型和 15 个开源模型。结果显示出五项关键发现:(1)专有模型在正确性和输出效果上优于开源模型,尽管部分开源模型在特定维度上表现具竞争力。(2)规模较大的开源模型总体表现更好,但随模型规模增大,提升效果逐渐减缓。(3)采用推理(“思考”)模式可提升输出效果,但会降低正确性,可能是因对简单任务过度复杂化。(4)开源模型在相关条款存在时更频繁地生成“无相关条款”响应,这表明其存在“懈怠”或在提取相关内容方面信心不足。(5)模型量化可加速推理,但以牺牲性能为代价,显示出效率与准确性之间的权衡。这些发现表明,尽管大多数 LLMs 的表现相当于初级法律助理,但开源模型需针对性微调以确保在高风险法律场景下的正确性和效果。ContractEval 为指导法律领域 LLMs 的未来发展提供了坚实基准。
引用
@article{arxiv.2508.03080,
title = {ContractEval: Benchmarking LLMs for Clause-Level Legal Risk Identification in Commercial Contracts},
author = {Shuang Liu and Zelong Li and Ruoyun Ma and Haiyan Zhao and Mengnan Du},
journal= {arXiv preprint arXiv:2508.03080},
year = {2025}
}