论将 arXiv 用作数据集
信息检索
2019-05-02 v1 机器学习
社会与信息网络
物理与社会
摘要
arXiv 在 28 年间收集了 150 万篇预印本文章,收录了包括物理学、数学和计算机科学在内的科学领域的文献。每篇预印本包含文本、图表、作者、引文、分类及其他元数据。这些丰富的多模态特征,结合由引文、隶属关系和合著关系所构成的自然图结构,使 arXiv 成为基准测试下一代模型的一个令人振奋的候选对象。在此,我们朝着这一目标迈出必要的第一步,提供了一条标准化并简化访问 arXiv 公开可用数据的流水线。我们利用该流水线提取并分析了包含 670 万条边的引文图,以及含有 110 亿词的全文研究文章语料库。我们给出了一些基线分类结果,并倡导应用更令人振奋的生成图模型。
引用
@article{arxiv.1905.00075,
title = {On the Use of ArXiv as a Dataset},
author = {Colin B. Clement and Matthew Bierbaum and Kevin P. O'Keeffe and Alexander A. Alemi},
journal= {arXiv preprint arXiv:1905.00075},
year = {2019}
}
备注
7 pages, 3 tables, 2 figures, ICLR 2019 workshop RLGM submission