中文

利用 BERT 改进专利中的参考文献挖掘

信息检索 2021-03-11 v3 计算与语言

摘要

在本文中,我们解决从专利中提取科学参考文献的挑战。我们将该问题视为序列标注任务,并研究 BERT 模型在提取这些长序列方面的价值。专利中对科学文献的引用对于研究科学与产业之间的联系具有相关性。大多数先前工作仅使用首页引文进行此分析,这些引文在专利档案的元数据中提供。在本文中,我们基于先前使用条件随机场(CRF)和 Flair 进行参考文献提取的工作。我们改进了训练数据的质量,并在标注数据上训练了三个基于 BERT 的模型(BERT、bioBERT、sciBERT)。我们发现改进的训练数据大幅提升了训练模型的质量。此外,BERT 模型优于 CRF 和 Flair,交叉验证获得的召回率分数约为 97%。利用最佳模型,我们标注了包含 3.3 万件专利的大型集合,提取引文并将其匹配到 Web of Science 数据库中的出版物。我们提取的参考文献比旧训练数据和方法多 50%:总计 73.5 万条参考文献。借助这些专利-出版物链接,后续研究将进一步分析哪些类型的科学工作导致了发明。

关键词

引用

@article{arxiv.2101.01039,
  title  = {Improving reference mining in patents with BERT},
  author = {Ken Voskuil and Suzan Verberne},
  journal= {arXiv preprint arXiv:2101.01039},
  year   = {2021}
}

备注

10 pages, 3 figures