它是否为新颖?基于段落检索的专利新颖性细粒度预测
计算与语言
2026-05-05 v1 人工智能
信息检索
摘要
新颖性评估是专利接受考试中的关键且复杂任务,需审查员确定发明是否在先前文献中披露。该过程涉及专利权利要求中具体特征与先前文献中段落之间的复杂匹配。虽然先前工作主要将新颖性预测视为权利要求级别的二元分类任务,但我们认为这种表述易受虚假相关性影响,且缺乏满足实际应用需求的细粒度。本文引入 FiNE-Patents (Fine-grained Novelty Examination of Patents),一个包含 3,658 条第一专利权利要求的新数据集,其标注包含从欧洲搜索意见 (ESOP) 文档中提取的细粒度特征级别先前文献参考。我们提出将评估范式从权利要求级别的简单二元分类转变为特征级别的联合检索和抽象推理任务,要求模型识别先前文献中披露单个权利要求特征的特定段落,并识别哪些特征使权利要求具有新颖性。我们实现并评估了基于大语言模型的工作流程,将权利要求分解为特征,对每个特征与先前文献进行分析,最终得出权利要求级别的新颖性预测。我们的实验表明,这些工作流程在段落检索和新颖特征识别方面优于基于嵌入的基线方法。此外,我们展示了与训练分类器不同,大语言模型对权利要求级别新颖性分类任务中存在的虚假相关性具有鲁健性。我们发布数据集和代码,以促进面向透明和细粒度专利分析的进一步研究。
引用
@article{arxiv.2605.02392,
title = {Is It Novel and Why? Fine-Grained Patent Novelty Prediction Based on Passage Retrieval},
author = {Valentin Knappich and Anna Hätty and Simon Razniewski and Annemarie Friedrich},
journal= {arXiv preprint arXiv:2605.02392},
year = {2026}
}
备注
Accepted to SIGIR 2026 https://doi.org/10.1145/3805712.3809576