中文

一种描述和分析批量生物注释质量的方法:以 UniProtKB 为例

计算工程、金融与科学 2013-08-22 v1 信息检索 基因组学

摘要

动机:注释是许多生物数据库的关键特征,用于向读者传达我们对序列的认识。理想情况下,注释应经过人工策展,但人工策展成本高昂、耗时且需要专业知识和培训。鉴于这些问题以及数据的指数级增长,许多数据库实施了自动注释流程,以避免出现未注释条目。手动和自动注释的质量在不同数据库和注释者之间存在差异,使得用户难以评估注释的可靠性。社区缺乏一种通用的衡量标准来确定注释的质量和正确性,本文旨在解决这一问题。具体而言,我们研究了批量文本注释中的词语复用情况,并将其与 Zipf 最小努力原则联系起来。我们选用 UniProt 知识库(UniProtKB)作为案例研究来展示该方法,因为它允许我们比较注释随时间的变化以及自动注释与人工策展注释之间的差异。结果:通过将幂律分布应用于注释中的词语复用,我们揭示了 UniProtKB 随时间变化的清晰趋势,这与现有针对自由文本英语的质量研究一致。此外,我们展示了手动分析与自动分析之间的明显区别,并研究了蛋白质记录群随成熟度的变化。这些结果表明,该方法作为判断注释质量的机制具有独特的前景。可用性:源代码可在作者网站获取:http://homepages.cs.ncl.ac.uk/m.j.bell1/annotation。联系方式:[email protected]

关键词

引用

@article{arxiv.1208.2175,
  title  = {An approach to describing and analysing bulk biological annotation quality: a case study using UniProtKB},
  author = {Michael J. Bell and Colin S. Gillespie and Daniel Swan and Phillip Lord},
  journal= {arXiv preprint arXiv:1208.2175},
  year   = {2013}
}

备注

Paper accepted at The European Conference on Computational Biology 2012 (ECCB'12). Subsequently will be published in a special issue of the journal Bioinformatics. Paper consists of 8 pages, made up of 5 figures