基于模型的聚类用于识别病例—对照全基因组关联研究中的疾病相关 SNP
统计方法学
2019-09-25 v2 机器学习
摘要
全基因组关联研究(GWASs)旨在通过识别疾病相关的单核苷酸多态性(SNPs)来检测复杂人类疾病的遗传风险因素。传统的逐 SNP 方法结合多重检验校正在许多 GWASs 中过于保守且缺乏功效。本文中,我们提出一种基于模型的聚类方法,将棘手的高维—小样本量问题转化为低维—大样本量问题,并通过将 SNPs 分为三类来跨 SNPs 借用信息。我们依据病例与对照间 SNPs 的次要等位基因频率预先指定各类模式,并以先验分布强制这些模式。在模拟研究中,我们提出的新模型以更好的错误发现率(FDR)控制与更高灵敏度优于传统逐 SNP 方法。我们重新分析两项真实研究以识别多发性骨髓瘤(MM)患者中与严重硼替佐米诱导周围神经病变(BiPN)相关的 SNPs。文献中的原始分析在 FDR 校正后未能识别出 SNPs。我们提出的方法不仅在 FDR 校正后检出了已报道的 SNPs,还发现了新的 BiPN 相关 SNP rs4351714,该 SNP 在另一研究中已被报道与 MM 相关。
引用
@article{arxiv.1806.08456,
title = {Model-based clustering for identifying disease-associated SNPs in case-control genome-wide association studies},
author = {Yan Xu and Li Xing and Jessica Su and Xuekui Zhang and Weiliang Qiu},
journal= {arXiv preprint arXiv:1806.08456},
year = {2019}
}