中文

第二代 PLINK:应对更大更丰富数据集的挑战

基因组学 2015-03-03 v1 统计计算

摘要

PLINK 1 是一套广泛用于全基因组关联研究(GWAS)和群体遗传学研究的开源 C/C++ 工具集。然而,来自填补和全基因组测序研究的数据稳步积累,暴露出对关键功能进行更快、更具可扩展性实现的强烈需求。此外,GWAS 和群体遗传数据现在经常包含概率调用、相位信息和/或多等位基因变异,这些都无法由 PLINK 1 的主要数据格式表示。为了解决这些问题,我们正在开发 PLINK 的第二代代码库。该代码库的第一个主要版本 PLINK 1.9 引入了广泛的位级并行性、O(n)O(\sqrt{n}) 时间/常数空间的 Hardy-Weinberg 平衡和 Fisher 精确检验,以及许多其他算法改进。综合起来,这些变化将大多数操作加速了 1-4 个数量级,并允许程序处理大到无法装入 RAM 的数据集。随后将推出 PLINK 2.0,它将引入 (a) 一种能够有效表示概率、相位和多等位基因变异的新数据格式,以及 (b) 许多功能的扩展以考虑新类型的信息。第二代版本的 PLINK 将在性能和兼容性方面提供显著的改进。首次使得无法访问高端计算资源的用户能够对日益使用的功能丰富且非常大的遗传数据集执行几项基本分析。

关键词

引用

@article{arxiv.1410.4803,
  title  = {Second-generation PLINK: rising to the challenge of larger and richer datasets},
  author = {Christopher C. Chang and Carson C. Chow and Laurent C. A. M. Tellier and Shashaank Vattikuti and Shaun M. Purcell and James J. Lee},
  journal= {arXiv preprint arXiv:1410.4803},
  year   = {2015}
}

备注

2 figures, 1 additional file