生物数据库构建偏差的检测:以 miRBase 为例
分子网络
2014-07-25 v1
摘要
生物数据库可以作为复杂网络进行分析,这可能揭示其潜在的生物学机制。通常,根据连通性分布或聚类系数,这些数据库被识别为无标度网络或层次网络。由于这些数据库随时间增长,可以预期其网络拓扑会发生一些变化。在此,我们分析了 miRBase 的历史版本,这是一个 microRNA 数据库,我们在其中对所有成熟 miRNA 和前体 miRNA 进行了比对,并计算了成对相似性指数。我们发现,在该数据库的增长过程中,聚类系数表现出显著变化。对于 2009 年的两个连续版本,我们发现网络拓扑发生了强烈改变,我们将其与 miRNA 发现的技术变革联系起来。为了评估这些变化是否可能偶然发生,我们通过对 miRBase 最终版本进行采样来模拟数据库的增长,并创建了 miRBase 的几种替代历史。没有任何模拟接近该数据库的实际历史演化,我们将此理解为存在极强构建偏差的明确标志。
引用
@article{arxiv.1407.6570,
title = {Detection of construction biases in biological databases: the case of miRBase},
author = {Guilherme Bicalho Saturnino and Caio Padoan de Sá Godinho and Denise Fagundes-Lima and Alcides Castro e Silva and Gerald Weber},
journal= {arXiv preprint arXiv:1407.6570},
year = {2014}
}
备注
9 pages, 8 figures