PDBMine:蛋白质数据银行的一种重构以促进结构数据挖掘
数据库
2019-11-21 v1 生物大分子
摘要
人类基因组计划、结构基因组学以及各研究团队等大规模计划已提供了大量的基因组与蛋白质组数据。将数据转化为知识已成为现有挑战之一,其原因在于这些数据被存入了为归档而非挖掘而最优设计的数据库中。在本研究中,我们以蛋白质数据银行(PDB)为对象,展示了一种名为 PDBMine 的内容转换方法,其将存储空间减少了一个数量级,并支持围绕蛋白质结构测定主题的强大挖掘能力。我们展示了 PDBMine 在探索二聚与三聚氨基酸序列普遍性方面的效用,并提供了一种预测蛋白质结构的机制。
引用
@article{arxiv.1911.08614,
title = {PDBMine: A Reformulation of the Protein Data Bank to Facilitate Structural Data Mining},
author = {Casey A Cole and Christopher Ott and Diego Valdes and Homayoun Valafar},
journal= {arXiv preprint arXiv:1911.08614},
year = {2019}
}
备注
6 pages, 8 figures, IEEE Annual Conf. on Computational Science & Computational Intelligence (CSCI), December 2019