中文

提出 Terrorizer:一种用于整合专利受让人中公司名称的算法

信息检索 2024-03-20 v1 计算与语言

摘要

公司名称的消歧问题在从专利中提取有用信息时构成了重大挑战。这一问题会使研究结果产生偏差,因为它通常低估了归属于公司的专利数量,特别是跨国公司,它们以大量名称申请专利,包括同一实体的不同拼写以及最终的公司子公司。迄今为止,应对这些挑战一直依赖于劳动密集型的基于字典或字符串匹配的方法,使得大型数据集上的专利受让人协调问题在很大程度上未得到解决。为了弥补这一差距,本文描述了 Terrorizer 算法,这是一种基于文本的算法,利用自然语言处理(NLP)、网络理论和基于规则的技术来协调记录为专利受让人的公司名称的变体。具体而言,该算法遵循其先前方法的三部分结构,即解析、匹配和过滤阶段,并增加了原始的“知识增强”阶段,用于丰富每个受让人名称上的可用信息。我们在 2005 年至 2022 年间 USPTO 授权专利的 325,917 个公司名称受让人集合上使用了 Terrorizer。Terrorizer 的性能在四个黄金标准数据集上进行了评估。这一验证步骤向我们展示了两个主要方面:首先,Terrorizer 在不同类型的数据集上性能相似,证明我们的算法具有良好的泛化能力。其次,当将其性能与 PatentsView 中目前用于相同任务的算法(Monath et al., 2021)进行比较时,它获得了更高的 F1 分数。最后,我们使用树结构 Parzen 估计器(TPE)优化算法进行超参数调优。我们的最终结果是初始名称集合减少了 42% 以上。

关键词

引用

@article{arxiv.2403.12083,
  title  = {Presenting Terrorizer: an algorithm for consolidating company names in patent assignees},
  author = {Grazia Sveva Ascione and Valerio Sterzi},
  journal= {arXiv preprint arXiv:2403.12083},
  year   = {2024}
}