利用监督学习按研究学科对研究数据元数据进行分类
信息检索
2019-10-22 v1 数字图书馆
机器学习
机器学习
摘要
按研究学科对研究数据元数据自动分类可用于科学计量研究、存储库服务提供商以及研究数据聚合服务。利用 DataCite 研究数据索引的公开可用元数据编制了一个由 609,524 条记录组成的大型训练与评估集,该数据集与本文一同发布。这些数据使得可复现地评估分类方法,例如基于树的模型和神经网络。根据我们在 20 个基类(多标签分类)上的实验,多层感知机模型表现最佳,f1-macro 得分为 0.760,紧随其后的是长短期记忆模型(f1-macro 得分为 0.755)。训练好的分类模型的一种可能应用是对数字学术成果跨学科趋势的定量分析,或按研究学科分层的研数据增长模式刻画。这两种应用均可借助所提出的、可复用的模型在大规模上执行。
引用
@article{arxiv.1910.09313,
title = {Using Supervised Learning to Classify Metadata of Research Data by Discipline of Research},
author = {Tobias Weber and Dieter Kranzlmüller and Michael Fromm and Nelson Tavares de Sousa},
journal= {arXiv preprint arXiv:1910.09313},
year = {2019}
}