中文

用于检测学术文献中非正式数据引用的自然语言处理流水线

数字图书馆 2023-05-03 v1 计算与语言 机器学习

摘要

发现出版物与其所使用数据集之间的权威链接可能是一个劳动密集型过程。我们引入了一种自然语言处理流水线,用于检索和审阅出版物以查找对研究数据集的非正式引用,这补充了数据馆员的工作。我们首先描述流水线的组成部分,然后将其应用于扩展一个权威参考书目,该参考书目将数千项社会科学研究与使用这些研究的数据相关出版物相链接。该流水线提高了待审阅以纳入数据相关出版物集合的文献的召回率,并使得大规模检测非正式数据引用成为可能。我们贡献了(1)一个可靠检测非正式数据引用的新颖命名实体识别(NER)模型,以及(2)一个将社会科学文献条目与其所引用的数据集相连接的数据集。这些贡献共同支持了未来关于数据引用、数据引文网络和数据复用的研究。

关键词

引用

@article{arxiv.2205.11651,
  title  = {A Natural Language Processing Pipeline for Detecting Informal Data References in Academic Literature},
  author = {Sara Lafia and Lizhou Fan and Libby Hemphill},
  journal= {arXiv preprint arXiv:2205.11651},
  year   = {2023}
}

备注

13 pages, 7 figures, 3 tables