中文

unarXive 2022:面向 NLP 的 arXiv 全部出版物预处理数据集,含结构化全文与引文网络

数字图书馆 2023-11-06 v1 计算与语言

摘要

学术论文的大规模数据集是多种文献计量分析与自然语言处理(NLP)应用的基础。尤其源自出版物全文的数据集近来备受关注。尽管已有若干此类数据集,我们认为其在领域与时间覆盖、引文网络完整性及全文内容表示方面存在关键不足。为应对这些问题,我们提出 unarXive 数据集的新版本。我们的数据处理流水线及输出格式基于两个已有数据集构建,并分别对二者作出改进。最终数据集包含跨越多个学科、历时 32 年的 1.9 M 篇出版物,其引文网络比前身更完整,并保留了更丰富的文档结构及数学符号等非文本出版内容表示。除数据集外,我们提供引文推荐与 IMRaD 分类的即用训练/测试数据。所有数据与源代码公开于 https://github.com/IllDepence/unarXive。

关键词

引用

@article{arxiv.2303.14957,
  title  = {unarXive 2022: All arXiv Publications Pre-Processed for NLP, Including Structured Full-Text and Citation Network},
  author = {Tarek Saier and Johan Krause and Michael Färber},
  journal= {arXiv preprint arXiv:2303.14957},
  year   = {2023}
}

备注

submitted to JCDL2023