中文

DeonticBench:用于规则推理的基准

计算与语言 2026-04-07 v1

摘要

与复杂情境特定规则进行推理仍然具有挑战性,这对于大型语言模型 (LLM) 来说尤为如此。在法律和政策场景中,这表现为 deontic 推理:关于在明确规则下进行义务、许可和禁止的推理。虽然许多最近的基准强调短情境数学推理,但少有关注长情境、高风险的 deontic 推理。为填补这一空白,我们引入 DEONTICBENCH,这是一个包含 6,232 个任务的数据集,覆盖美国联邦税务、航空行李政策、美国移民管理以及美国各州房地产法。这些任务可以以多种方式处理,包括在语言中直接推理或辅以符号计算。除了自由形式的链式思考推理之外,DEONTICBENCH 还支持一种可选的求解器工作流程,其中模型将法规和案件事实翻译为可执行的 Prolog,导致形式化的问题解释和显式的程序轨迹。我们为所有实例发布参考 Prolog 程序。在各大前沿 LLM 和编码模型中,最佳难子集性能仅在 SARA Numeric 上达到 44.4%,在 Housing 上达到 46.6% 的macro-F1。我们进一步研究使用监督微调和强化学习进行符号程序生成的训练。尽管训练改进了 Prolog 生成质量,但当前的 RL 方法仍不可靠地解决这些任务。总体而言,DEONTICBENCH 提供了一个用于在符号和非符号设置下研究情境嵌入规则推理的基准。

关键词

引用

@article{arxiv.2604.04443,
  title  = {DeonticBench: A Benchmark for Reasoning over Rules},
  author = {Guangyao Dou and Luis Brena and Akhil Deo and William Jurayj and Jingyu Zhang and Nils Holzenberger and Benjamin Van Durme},
  journal= {arXiv preprint arXiv:2604.04443},
  year   = {2026}
}