中文

LEXam:衡量 340 场法律考试的法律推理基准

计算与语言 2026-04-03 v7 人工智能 机器学习

摘要

尽管近期在测试时间扩展方面取得了进展,长篇法律推理仍是大型语言模型(LLM)的一个关键挑战。为此,我们引入 LEXam,一个源自 340 场跨越 116 门法学院课程的法律考试的新型基准数据集。该数据集包含 7,537 题英文和德语的法律考试问题。它包括长篇开放式问题和选项数目可变的选择题。除了参考答案外,开放式问题还附有明确的指导,概述了预期的法律推理方法,如问题发现、规则回忆或规则应用。我们对开放式和选择题的评估显示,当前 LLM 在面临巨大挑战;特别是,他们在需要结构化、多步骤法律推理的开放式问题方面表现不佳。此外,我们的结果凸显了该数据集在区分不同能力模型方面的有效性。通过部署以严格的人类专家验证为依据的 LLM-as-a-Judge 小组合流范式,我们展示了模型生成的推理步骤能够一致且准确地进行评估,与人类专家评估高度一致。我们的评估设置提供了一种可扩展的方法,用于评估超越简单准确率指标的法律推理质量。项目页面:https://lexam-benchmark.github.io/。

关键词

引用

@article{arxiv.2505.12864,
  title  = {LEXam: Benchmarking Legal Reasoning on 340 Law Exams},
  author = {Yu Fan and Jingwei Ni and Jakob Merane and Yang Tian and Yoan Hermstrüwer and Yinya Huang and Mubashara Akhtar and Etienne Salimbeni and Florian Geering and Oliver Dreyer and Daniel Brunner and Markus Leippold and Mrinmaya Sachan and Alexander Stremitzer and Christoph Engel and Elliott Ash and Joel Niklaus},
  journal= {arXiv preprint arXiv:2505.12864},
  year   = {2026}
}

备注

Accepted to ICLR 2026