BioSample在线存储库的元数据因大量异常而受损
数据库
2017-08-07 v1
摘要
关于科学实验的元数据对于查找、重现和复用这些元数据所描述的数据至关重要。我们展示了一项关于BioSample中存储的元数据质量的研究——BioSample是由美国国家生物技术信息中心(NCBI)管理的生物医学实验所用样本的元数据存储库。我们测试了660万条BioSample元数据记录是否填充了满足规定要求的值。我们的研究揭示了所分析元数据中的多种异常。BioSample的元数据字段名称及其值未标准化或受控——15%的元数据字段使用了BioSample数据字典中未指定的字段名称。在452个BioSample指定的字段中,仅有9个通常要求以本体术语作为值,而这些受控字段的质量优于非受控字段,因为即使是简单的二进制或数值字段也常常填充了不同数据类型的不适当值(例如,只有27%的布尔值是有效的)。总体而言,BioSample中的元数据表明,缺乏原则性的机制来执行和验证元数据要求。元数据中的这些异常很可能会阻碍相关数据集的搜索和二次利用。
引用
@article{arxiv.1708.01286,
title = {Metadata in the BioSample Online Repository are Impaired by Numerous Anomalies},
author = {Rafael S. Gonçalves and Martin J. O'Connor and Marcos Martínez-Romero and John Graybeal and Mark A. Musen},
journal= {arXiv preprint arXiv:1708.01286},
year = {2017}
}