中文

迈向开放研究知识图谱中研究数据集元数据的 FAIR 语义发布

数字图书馆 2024-04-15 v1 信息检索

摘要

如今的搜索引擎可以将数据集作为搜索结果提供。搜索引擎基于数据集官方网页上的结构化描述来抓取数据集,这些描述由 schema.org 的 Dataset 内容类型等元数据本体提供信息。尽管数据集作为搜索结果的一等公民得到了推广,但很大一部分数据集,特别是研究数据集,仍需提高其可发现性,因此在很大程度上未被使用。这是由于每天发布的数据集数量庞大,且元数据无法准确反映数据集的内容和语境。本工作旨在改善特定类别数据集,即研究数据集的这一状况,这些数据集是研究努力的成果并伴有学术出版物。我们提出了 ORKG-Dataset 内容类型,这是开放研究知识图谱(ORKG)平台的一个专门分支,为研究数据集提供描述性信息和语义模型,并将其与相关的学术出版物集成。本工作旨在建立一个标准化框架,用于在 ORKG-Dataset 内容类型中记录和报告研究数据集。这反过来提高了网络上研究数据集的透明度,从而改善其可发现性和应用。在本文中,我们提出了一项提案——基于其支持出版物的显著特征,对研究数据集进行最低限度的 FAIR、可比较的语义描述。我们基于科学信息提取领域的 40 个不同研究数据集,设计了 ORKG-Dataset 语义模型的具体应用。

关键词

引用

@article{arxiv.2404.08443,
  title  = {Toward FAIR Semantic Publishing of Research Dataset Metadata in the Open Research Knowledge Graph},
  author = {Raia Abu Ahmad and Jennifer D'Souza and Matthäus Zloch and Wolfgang Otto and Georg Rehm and Allard Oelen and Stefan Dietze and Sören Auer},
  journal= {arXiv preprint arXiv:2404.08443},
  year   = {2024}
}

备注

8 pages, 1 figure, published in the Joint Proceedings of the Onto4FAIR 2023 Workshops