中文

推断出的谱系及其可视化能否用于检测错误标注?——基于 UniProtKB 的案例研究

计算与语言 2013-08-22 v1 计算工程、金融与科学 数字图书馆 定量方法

摘要

新数据的持续涌入给保持生物数据库中注释的时效性带来了挑战。大多数生物数据库包含大量文本注释,这往往是知识最丰富的来源。许多数据库在策展过程中复用现有知识,注释经常在条目间传播。然而,这一过程通常未予明确说明。因此,读者很难甚至无法识别注释的来源。在本工作中,我们试图识别注释谱系并追踪其后续传播。具体而言,我们在 UniProt 知识库 (UniProtKB) 中利用句子层面的注释复用。我们描述了一种用于可视化 UniProtKB 中句子谱系和传播的方法,该方法使得大规模统计分析成为可能。初步分析显示 UniProtKB 内句子复用现象极为普遍,这使得追踪谱系和传播成为可能。通过对整个 UniProtKB 中句子的分析,我们识别出多种有趣的传播模式,涵盖超过 100,000 个句子。超过 8000 个句子在其原始出现条目被删除后仍保留在数据库中。对这些句子的一个子集进行分析表明,约 30% 存在错误,而 35% 似乎不一致。这些结果表明,能够可视化句子传播和谱系有助于判定文本注释的准确性和质量。源代码和补充数据可从作者网站获取。

关键词

引用

@article{arxiv.1308.4618,
  title  = {Can inferred provenance and its visualisation be used to detect erroneous annotation? A case study using UniProtKB},
  author = {Michael J. Bell and Matthew Collison and Phillip Lord},
  journal= {arXiv preprint arXiv:1308.4618},
  year   = {2013}
}

备注

Paper to shortly appear in PLOS ONE. Composed of 21 pages and 16 figures