Magis-Bench:评估 LLM 在法官级法律任务上的能力
计算与语言
2026-05-12 v1 人工智能
摘要
现有法律 AI 基准主要聚焦于 LLM 必须生成法律论证或文件的任务,而评估此类论证——权衡竞争性主张、将原则适用于事实并作出理性裁决的能力——的评估,或许是功能完善法律体系所必需的。我们提出 Magis-Bench,这是一个源自巴西近期司法考试中司法员级写作任务的基准测试。Magis-Bench 包含 2023-2025 年间八场考试的 74 个问题,包括结构为多轮的论述性法律分析题目以及需撰写完整民事和刑事司法文书的实践练习。我们使用由四个前沿模型作为评估者的 LLM-as-a-judge 方法,对 23 个最新 LLM 进行评估。结果显示强好的判官间一致性(Kendall 的 ;两两 Kendall 的 ),谷歌的 Gemini-3-Pro-Preview 获得最高平均得分(6.97/10),随后是 Gemini-3-Flash-Preview(6.67)和 Claude-4.5-Opus(6.46)。即便是最佳模型也得分不到 70%,表明司法级别的法律推理与写作仍是当前 LLM 的挑战。我们发布完整的基准测试、模型输出及评估代码,以支持进一步的法律 AI 能力研究。
引用
@article{arxiv.2605.08437,
title = {Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks},
author = {Ramon Pires and Thales Sales Almeida and Celio Larcher Junior and Giovana Bonás and Hugo Abonizio and Marcos Piau and Roseval Malaquias Junior and Thiago Laitz and Rodrigo Nogueira},
journal= {arXiv preprint arXiv:2605.08437},
year = {2026}
}