中文

CHANCERY:评估语言模型的公司治理推理能力

人工智能 2025-06-13 v2 计算与语言

摘要

法律长期以来是自然语言处理(NLP)应用的热门领域。推理(推理和建立与先例联系)是法律实践的核心能力。尽管存在多个法律数据集,但尚无数据集专注于推理任务。我们聚焦于法律领域的一个具体方面,引入公司治理推理基准(CHANCERY),以测试模型是否能推理执行/董事/股东提议的行动是否符合公司治理章程。该基准首次引入公司治理推理测试,模仿真实世界公司治理法。基准包含公司章程(一组治理条款)和执行行动提案。模型任务为二元分类:推理该行动是否符合章程中所含规则。我们遵循既定公司治理原则——纳入 24 项具体公司治理原则和选取 79 份真实公司章程(代表来自总计 1 万份章程的不同行业)。在 SOTA 推理模型评估中,基准难度显著,Claude 3.7 Sonnet 和 GPT-4o 分别达到 64.5% 和 75.2% 准确率。基于 ReAct 和 CodeAct 框架的推理代理表现更佳,分别达到 76.1% 和 78.1%,进一步证实在该基准上取得高分所需的先进法律推理能力。我们还分析当前推理模型难以应对的问题类型,揭示 SOTA 模型的法律推理能力。

关键词

引用

@article{arxiv.2506.04636,
  title  = {CHANCERY: Evaluating Corporate Governance Reasoning Capabilities in Language Models},
  author = {Lucas Irwin and Arda Kaz and Peiyao Sheng and Sewoong Oh and Pramod Viswanath},
  journal= {arXiv preprint arXiv:2506.04636},
  year   = {2025}
}