一种新颖的专利相似性度量方法:语义距离与技术距离
信息检索
2023-12-04 v2 人工智能
社会与信息网络
摘要
专利相似性分析在评估专利侵权风险中起着关键作用。然而,该分析主要由法律专家人工进行,往往耗时漫长。自然语言处理技术的近期进展为自动化此过程提供了有前景的途径。但是,度量专利间相似性的方法仍依赖专家人工分类专利。由于人工智能技术的近期发展,许多研究聚焦于利用自然语言处理技术的专利语义相似性。然而,专利数据作为表征复杂技术的法律文档,难以用现有自然语言处理技术准确分析。为应对这些局限,我们提出一种混合方法,考虑书目相似性,通过考量专利的语义相似性、专利间技术相似性以及专利的书目信息来度量专利间相似性。利用自然语言处理技术,我们基于专利文本度量语义相似性,并通过国际专利分类(IPC)代码共现程度计算技术相似性。专利书目信息的相似性利用其特殊属性计算:引文信息、发明人信息与受让人信息。我们提出一个对各项考虑的相似性方法赋予合理权重的模型。在专家协助下,我们对 420 对专利进行人工相似性评估,并基于此数据评估模型性能。我们经实证表明,我们的方法优于近期自然语言处理技术。
引用
@article{arxiv.2303.16767,
title = {A Novel Patent Similarity Measurement Methodology: Semantic Distance and Technological Distance},
author = {Yongmin Yoo and Cheonkam Jeong and Sanguk Gim and Junwon Lee and Zachary Schimke and Deaho Seo},
journal= {arXiv preprint arXiv:2303.16767},
year = {2023}
}