利用主成分分析检测自然选择的基因组特征:应用于 1000 Genomes 数据
种群与进化
2015-11-19 v5
摘要
为了表征自然选择,已开发出各种用于检测候选基因组区域的分析方法。我们提出利用主成分分析进行全基因组自然选择扫描。我们表明,群体间遗传分化的常用 Fst 指数可以视为主成分解释的方差比例。考虑遗传变异与每个主成分之间的相关性,提供了一个在不预先定义群体的情况下检测涉及局部适应的遗传变异的概念框架。为了验证基于 PCA 的方法,我们考虑了去除近期混合个体后的 1000 Genomes 数据(第 1 阶段), resulting in 850 个来自非洲、亚洲和欧洲的个体。遗传变异的数量约为 3600 万,是通过低覆盖度测序深度 (3X) 获得的。遗传变异与每个主成分之间的相关性提供了众所周知的正向选择目标(EDAR, SLC24A5, SLC45A2, DARC),以及新的候选基因(APPBPP2, TP1A1, RTTN, KCNMA, MYO5C)和非编码 RNA。除了识别涉及生物适应的基因外,我们还确定了两个涉及多基因适应的生物通路,它们与先天免疫系统(-防御素)和脂质代谢(脂肪酸-氧化)有关。对欧洲数据的额外分析表明,即使在没有明确定义的群体时,基于 PCA 的基因组扫描也能检索到局部适应的经典案例。在 PCAdapt R 包和 PCAdapt 开源软件中实现的基于 PCA 的统计量检索到了已知的人类适应信号,这对未来的全基因组测序项目令人鼓舞,特别是在难以定义群体时。
引用
@article{arxiv.1504.04543,
title = {Detecting genomic signatures of natural selection with principal component analysis: application to the 1000 Genomes data},
author = {Nicolas Duforet-Frebourg and Keurcien Luu and Guillaume Laval and Eric Bazin and Michael G. B. Blum},
journal= {arXiv preprint arXiv:1504.04543},
year = {2015}
}