中文

基于系谱与群体数据的快速全基因组 QTL 关联定位

应用统计 2014-12-23 v2 基因组学 种群与进化 统计计算

摘要

由于大多数全基因组关联研究 (GWAS) 分析软件目前仅利用无亲缘关系个体,因此亟需能够处理一般系谱数据或群体与系谱混合数据的高效应用。即使被认为仅由无亲缘关系个体组成的数据集,也可能包含隐性亲缘关系,若未被发现和控制,可能导致假阳性结果。此外,家系设计具有显著优势:它们更擅长检测罕见变异、控制群体分层,并便于研究亲本来源效应。针对极端性状值选择的系谱往往分离出具有强效应的单基因。最后,许多系谱作为连锁分析时代的重要遗产可供使用。不幸的是,系谱似然值的计算 notoriously 困难。本文重新审视了计算瓶颈,并实现了超快的基于系谱的 GWAS 分析。亲缘系数既可以基于明确提供的系谱,也可以从密集标记中自动估计。我们的策略:(a) 适用于随机样本数据、系谱数据或两者的混合;(b) 不损失统计功效;(c) 允许任意数量的协变量调整,包括对群体分层的校正;(d) 允许在加性、显性和隐性模型下测试 SNP;(e) 兼容单变量和多变量数量性状。在典型的个人计算机(6 核 CPU,2.67 GHz)上,分析来自圣安东尼奥家族心脏研究 (San Antonio Family Heart Study) 的单变量 HDL(高密度脂蛋白)性状(124 个系谱中的 1357 个个体,935,392 个 SNP)耗时不到 2 分钟,内存占用 1.5 GB。对纵向 HDL 多变量性状的三个时间点进行完整的多变量 QTL 分析,耗时不到 5 分钟,内存占用 1.5 GB。

关键词

引用

@article{arxiv.1407.8253,
  title  = {Fast Genome-Wide QTL Association Mapping on Pedigree and Population Data},
  author = {Hua Zhou and John Blangero and Thomas D. Dyer and Kei-hang K. Chan and Kenneth Lange and Eric M. Sobel},
  journal= {arXiv preprint arXiv:1407.8253},
  year   = {2014}
}