中文

PEDANTIC:用于专利权利要求确定性自动审查的数据集

计算与语言 2025-06-19 v3

摘要

专利权利要求界定了发明的保护范围。如果权利要求中存在歧义,将被专利局驳回。在美国,这被称为不确定性(35 U.S.C {\S} 112(b)),是专利申请被驳回的最常见原因之一。开发专利确定性自动审查方法有望提高专利起草和审查的效率,但迄今为止尚未发布过标注数据集。我们引入了 PEDANTIC(专利确定性审查语料库),这是一个包含 14k 项与自然语言处理(NLP)相关的专利申请中美国专利权利要求的新颖数据集,并标注了不确定性原因。我们使用全自动流水线构建 PEDANTIC,该流水线从 USPTO 检索审查意见通知书,并利用大型语言模型(LLM)提取不确定性原因。人工验证研究证实了该流水线在生成高质量标注方面的准确性。为了超越二元分类指标以获得更深入的见解,我们实施了 LLM-as-Judge 评估,将每个模型引用原因的自由形式推理与每个审查员引用原因进行比较。我们表明,基于 Qwen 2.5 32B 和 72B 的 LLM 智能体在确定性预测上难以超越逻辑回归基线,尽管它们通常能正确识别潜在原因。PEDANTIC 为专利 AI 研究人员提供了宝贵的资源,使开发高级审查模型成为可能。我们将公开发布该数据集和代码。

关键词

引用

@article{arxiv.2505.21342,
  title  = {PEDANTIC: A Dataset for the Automatic Examination of Definiteness in Patent Claims},
  author = {Valentin Knappich and Annemarie Friedrich and Anna Hätty and Simon Razniewski},
  journal= {arXiv preprint arXiv:2505.21342},
  year   = {2025}
}

备注

PatentSemTech@SIGIR2025