一种基于特征值比的全基因组测序数据群体结构推断方法
应用统计
2022-05-17 v7
摘要
从遗传数据推断群体结构在群体遗传学与医学遗传学研究中具有重要作用。随着测序技术的进步与成本下降,日益可得的全基因组测序数据提供了关于潜在群体结构更丰富的信息。最初为基于芯片的基因型数据开发的、用于计算并选择捕获群体结构的主成分的传统方法(Patterson, Price, and Reich, 2006)在测序数据上可能表现不佳,原因有二。首先,测序数据中遗传变异数 p 远大于样本量 n,使得样本-标记比 n/p 近乎为零,违背了该方法所用 Tracy-Widom 检验的假设。其次,其方法可能不能很好地处理测序数据中的连锁不平衡。为解决这两个实际问题,我们提出一种称为 ERStruct 的新方法,基于测序数据确定最具信息量的前几个主成分的个数。更具体地,我们提出使用连续特征值之比作为更稳健的检验统计量,然后利用现代随机矩阵理论近似其零分布。模拟研究以及对来自 HapMap 3 与 1000 Genomes 计划的两个公共数据集的应用均展示了我们 ERStruct 方法的实证表现。
引用
@article{arxiv.2104.01944,
title = {An Eigenvalue Ratio Approach to Inferring Population Structure from Whole Genome Sequencing Data},
author = {Yuyang Xu and Zhonghua Liu and Jianfeng Yao},
journal= {arXiv preprint arXiv:2104.01944},
year = {2022}
}