PILOT-Bench:面向专利领域法律推理且对齐 IRAC 分类任务的基准测试
计算与语言
2026-01-09 v1 人工智能
摘要
美国专利商标局 (USPTO) 的专利审判与上诉委员会 (PTAB) 每年裁决数千起单方上诉,这需要将技术理解与法律推理相结合。尽管大型语言模型 (LLM) 越来越多地应用于专利和法律实践中,但其使用仍局限于轻量级任务,尚无系统评估其在专利领域结构化法律推理能力的既定方法。在本研究中,我们引入了 PILOT-Bench,这是首个以 PTAB 为中心的基准测试,它在案例级别将 PTAB 决策与 USPTO 专利数据对齐,并形式化了三项对齐 IRAC 的分类任务:问题类型、委员会权威和子决策。我们评估了多种闭源(商业)和开源 LLM,并从多个视角进行了分析,包括输入变化设置、模型家族和错误倾向。值得注意的是,在问题类型任务上,闭源模型的 Micro-F1 分数始终超过 0.75,而最强的开源模型 (Qwen-8B) 的性能约为 0.56,突显了推理能力上的巨大差距。PILOT-Bench 为专利领域法律推理的系统评估奠定了基础,并指明了通过数据集设计和模型对齐来改进 LLM 的未来方向。所有数据、代码和基准测试资源均可在 https://github.com/TeamLab/pilot-bench 获取。
引用
@article{arxiv.2601.04758,
title = {PILOT-Bench: A Benchmark for Legal Reasoning in the Patent Domain with IRAC-Aligned Classification Tasks},
author = {Yehoon Jang and Chaewon Lee and Hyun-seok Min and Sungchul Choi},
journal= {arXiv preprint arXiv:2601.04758},
year = {2026}
}
备注
Accepted at the NLLP Workshop at EMNLP 2025