FullRecall:基于语义搜索的专利检索排序方法以最大化召回率
信息检索
2025-07-22 v1 机器学习
摘要
专利评审员和发明者面临着压力以验证发明的原创性和显著性,而专利数据的复杂性加剧了专利检索的挑战。因此,迫切需要设计能够可靠实现所需召回率的前沿检索策略。本研究介绍 FullRecall,一种新颖的专利检索方法,有效管理专利数据的复杂性,同时保持相关性匹配的可靠性并最大化召回率。它利用 IPC 指导的知识生成信息丰富的短语,处理这些短语以提取关键信息,形式为表征所观察查询专利的名词短语。从中选择前 k 个关键短语,用于检索数据集的精细子集。该初始检索步骤实现完整召回,成功捕获所有相关文档。为进一步细化结果,应用排序方案对检索到的子集进行排序,减小其规模 while maintaining 100% recall。该多阶段过程展示了一种有效的策略,用于在专利检索任务中平衡精度和召回率。进行了全面实验,结果与基准研究进行了比较,即 HRR2 [1] 和 ReQ-ReC [2]。该方法取得了优异结果,在所有五个测试案例中实现了 100% 召回率。然而,HRR2 [1] 在五个测试案例中的召回率为 10%、25%、33.3%、0% 和 14.29%,而 ReQ-ReC [2] 仅对第一个测试案例显示 50%,第二个测试案例显示 25%,第三个、第四个和第五个测试案例显示 0%。100% 召回率确保不遗漏任何相关的现有技术,从而加强专利立项和审查过程,减少潜在的法律风险。
引用
@article{arxiv.2507.14946,
title = {FullRecall: A Semantic Search-Based Ranking Approach for Maximizing Recall in Patent Retrieval},
author = {Amna Ali and Liyanage C. De Silva and Pg Emeroylariffion Abas},
journal= {arXiv preprint arXiv:2507.14946},
year = {2025}
}