中文

生物科学中的全计算可复现性:方法、软件及蛋白质生物学案例研究

定量方法 2016-08-25 v1

摘要

随着计算在众多科学分支中扮演越来越核心的角色,科学成果的独立计算可复现性正迅速成为科学进步的关键。历史上,可复现性遵循人们熟悉的波普尔[38]模型,即理论无法通过科学检验被证实,只能被证伪。归根结底,这意味着如果一项实验无法以某种令人满意的精度水平被独立复现,其价值本质上不可量化;直白地说,无法确定其科学价值。软件在大多数科学工作中日益增长的存在,增加了一层新的且尤为不透明的复杂性[29]。尽管近来许多科学领域对此兴趣浓厚,但重点仍更多地放在程序、限制和讨论上[12,14,16,29,30,37,41],这反映出大多数科学期刊在软件方面的经验不足,而非关注计算可复现性实际上如何实现的细节,而关于此方面似乎指导性实例相对较少[6,10,17]。在考量基本原理之后,本文以一项基于开放SwissProt蛋白质数据库的多GB级蛋白质研究为案例,展示了如何在实践中从数据下载一直到逐个图表的复现,在每一个阶段实现全计算可复现性,以此作为通用科学计算的范例。

关键词

引用

@article{arxiv.1608.06897,
  title  = {Full Computational Reproducibility in Biological Science: Methods, Software and a Case Study in Protein Biology},
  author = {Les Hatton and Gregory Warr},
  journal= {arXiv preprint arXiv:1608.06897},
  year   = {2016}
}

备注

17 pages, 1 figure, extends cited PlOS ONE paper demonstrating how to reproduce it precisely