OpenExempt:法律推理诊断基准与按需创建自定义基准的框架
计算与语言
2026-01-21 v1
摘要
推理基准在语言模型的发展中发挥了至关重要的作用。然而,由于静态问答对仅能提供性能的快照,将复杂行为压缩为单一的准确率指标,因此严格的评估仍然是一项重大挑战。这一局限性在法律等复杂的、受规则约束的领域尤为明显,现有基准构建成本高昂且不适合隔离特定的失败模式。为了解决这一问题,我们引入了 OpenExempt,这是一个用于法律推理诊断评估的框架和基准。OpenExempt 框架使用专家手工构建的美国破产法法规符号表示,按需动态生成大规模自然语言推理任务及其机器可计算的解。这赋予用户对任务复杂度和范围的细粒度控制能力,使得各项推理技能可以被独立探测。使用该系统,我们构建了 OpenExempt 基准,这是一个包含 9,765 个样本的法律推理诊断基准,涵盖九个评估套件,旨在仔细探测模型能力。在 13 个不同的语言模型上进行的实验揭示了仅在较长推理路径下以及存在混淆语句时才会出现的急剧性能下降。我们公开发布该框架和基准,以支持旨在理解和改进下一代推理系统的研究。
引用
@article{arxiv.2601.13183,
title = {OpenExempt: A Diagnostic Benchmark for Legal Reasoning and a Framework for Creating Custom Benchmarks on Demand},
author = {Sergio Servantez and Sarah B. Lawsky and Rajiv Jain and Daniel W. Linna and Kristian Hammond},
journal= {arXiv preprint arXiv:2601.13183},
year = {2026}
}
备注
25 pages, 9 Figures, 15 tables