基因组数据的数据库性能基准测试
数据库
2020-08-18 v1
摘要
基因组区域表示诸如基因注释、转录因子结合位点和表观遗传修饰等特征。执行各种基因组操作(如识别重叠/非重叠区域或最近的基因注释)是常见的科研需求。数据可存入数据库系统以便于管理,然而目前尚无全面的数据库内置算法来识别重叠区域。为此我开发了基于 SQL 的区域映射(RegMap)算法来执行基因组操作,并对不同数据库的性能进行了基准测试。基准测试发现 PostgreSQL 提取重叠区域远快于 MySQL。PostgreSQL 的插入与数据上传也更优,尽管两数据库的一般搜索能力几乎相当。此外,利用该算法进行成对比较,报告了从既往文献收集的超过 1000 个转录因子结合位点与组蛋白标记数据集的重叠情况,并发现 HNF4G 与黏连蛋白亚基 STAG1(SA1)显著共定位。
引用
@article{arxiv.2008.06835,
title = {Benchmarking database performance for genomic data},
author = {Matloob Khushi},
journal= {arXiv preprint arXiv:2008.06835},
year = {2020}
}