GAP:通过纳米发表增强基因组数据集与溯源的语义互操作性
数据库
2021-11-19 v2 数字图书馆
信息检索
摘要
尽管在科学存储库中发布数据集已得到广泛认可,这些存储库往往存在日益增长的语义相关问题。例如,它们对机器可操作过程(尤其在生物存储库中)呈现出各种数据重用障碍,阻碍了科学实验的可重复性。GenBank 数据库即为这些缺陷的一个例子。我们提出 GAP,一种增强语义数据含义以解决这些问题的创新数据模型。该模型侧重于融合数据溯源、语义互操作性、FAIR 原则和纳米发表等相关方法。我们的实验包括一个抓取基因组数据并将其追溯至纳米发表的概念验证原型。为此,(元)数据存储在三级纳米发表数据模型中。第一级与目标生物相关,依据生物分类学指定数据。第二级聚焦于目标的生物菌株,这是我们贡献的核心部分。菌株表达与基因组物质的遗传变异(元)数据解读相关的信息。第三级存储相关科学论文的(元)数据。我们期望通过纳入并采用相关方法以在所提模型中存储基因组数据,它将提供更高的数据存储灵活性以及与其他数据源更广泛的互操作性。
引用
@article{arxiv.2111.08739,
title = {GAP Enhancing Semantic Interoperability of Genomic Datasets and Provenance Through Nanopublications},
author = {Matheus Feijoó and Rodrigo Jardim and Sergio Serra and Maria Luiza Campos},
journal= {arXiv preprint arXiv:2111.08739},
year = {2021}
}
备注
12 pages, to be published in "Metadata and Semantic Research"