中文

BenGER:德国法律中基于包含关系的法律推理评估大语言模型系统的基准测试

计算与语言 2026-05-28 v1 人工智能

摘要

我们介绍了 BenGER(Benchmark for German Law)数据集,用于评估大语言模型在德国法律中基于包含关系的法律推理能力。BenGER 数据集包含三个组成部分:596 个考试风格的自由文本法律案例任务,涵盖多个法律教育水平;以及 531 个简短的 doctrine 推理任务。我们评估了 12 个当代大语言模型系统——包括封闭旗舰型、面向效率导向和开源权重的模型——使用自动化和法官评估指标。对于在限定时间的人类撰写解答的受控验证子集,我们分别在未辅助和人类-AI 协同创作条件下,将模型性能置于这些人类基准之中。我们引入了一个与 rubric 对齐的大语言模型评判框架,经过交叉验证,与多评分人的人类评分协议(每解答三个盲审评分人 plus 一个作者导师式的创建者评分人)相吻合。我们的结果表明,用 LLM 评判取代盲人类评判者,与完整人类小组的一致性下降不超过完全移除该评判者(Calderon r=0.96 vs. r=0.96, 匹配 n=30),封闭旗舰系统在所有语料库中领先,且人类-AI 协同创作显著优于未辅助的人类工作。

关键词

引用

@article{arxiv.2605.28183,
  title  = {BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law},
  author = {Sebastian Nagl and Ann-Kristin Mayrhofer and Martin Heidebach and Aleyna Koçak and Anne Zettelmeier and Elly Breu and Angelina Greiner and Sofija Milijas and Matthias Grabmair},
  journal= {arXiv preprint arXiv:2605.28183},
  year   = {2026}
}

备注

Pre-Print