中文

利用 BibTeX 自动生成用于引文字段抽取的标注数据

信息检索 2020-06-11 v1

摘要

准确解析引文参考字符串对于自动构建如 Google Scholar 或 Semantic Scholar 等学术数据库至关重要。引文字段抽取(CFE)正是这一任务——给定一条参考文献,标注出哪些词元对应作者、出版地、标题、编辑、期刊、页码等。大多数 CFE 方法为有监督方法,依赖于标注数据集进行训练,而相较于参考格式的极大多样性,这些数据集规模相当小。BibTeX 作为广泛使用的参考文献管理工具,为自动生成并标注 CFE 训练数据提供了一种自然的方法。在本文中,我们描述了一种利用 BibTeX 自动生成大规模(4100 万条标注字符串)标注数据集的技术,该数据集比当前最大的 CFE 数据集(即 UMass Citation Field Extraction 数据集 [Anzaroot and McCallum, 2013])大四个数量级。我们通过实验展示了如何使用我们的数据集,基于 RoBERTa [Liu et al., 2019] 模型来提升 UMass CFE 的性能。与先前 SOTA 相比,我们实现了 24.48% 的相对错误率降低,取得了 96.3% 的跨度级 F1 分数。

关键词

引用

@article{arxiv.2006.05563,
  title  = {Using BibTeX to Automatically Generate Labeled Data for Citation Field Extraction},
  author = {Dung Thai and Zhiyang Xu and Nicholas Monath and Boris Veytsman and Andrew McCallum},
  journal= {arXiv preprint arXiv:2006.05563},
  year   = {2020}
}