中文

基于技术术语动态主题模型分析技术进展以修订专利分类代码

计算与语言 2020-12-21 v1

摘要

日本专利被分配一个日本独有的专利分类代码 FI(File Index)。FI 是国际专利分类代码 IPC 的细分,与日本技术相关。FI 会为跟上技术发展而修订。这些修订自 2006 年以来已新设逾 30,000 个 FI。然而,这些修订耗时耗力。此外,这些修订未实现自动化,因而效率低下。因此,利用机器学习辅助专利分类代码(FI)的修订将提升准确性与效率。本研究从以机器学习辅助专利分类代码修订这一新视角分析专利文献。为分析专利的时间序列变化,我们采用了动态主题模型(DTM),其为潜在狄利克雷分配(LDA)的扩展。并且,与英语不同,日语需要形态分析。专利包含许多日常生活中不使用的技术词,因此使用通用词典的形态分析并不充分。为此,我们采用了一种从文本中提取技术术语的技术。提取技术术语后,将其应用于 DTM。本研究中,我们确定了照明类 F21 长达 14 年的技术进展,并与专利分类代码的实际修订进行比较。换言之,我们从日本专利中提取技术术语并应用 DTM 以确定日本技术的进展。然后,我们从以机器学习修订专利分类代码的新视角分析了结果。结果发现,那些主题呈上升趋势的被判定为新技术。

关键词

引用

@article{arxiv.2012.10120,
  title  = {Technical Progress Analysis Using a Dynamic Topic Model for Technical Terms to Revise Patent Classification Codes},
  author = {Mana Iwata and Yoshiro Matsuda and Yoshimasa Utsumi and Yoshitoshi Tanaka and Kazuhide Nakata},
  journal= {arXiv preprint arXiv:2012.10120},
  year   = {2020}
}