家系全基因组关联研究数据中多个重要单核苷酸多态性的同时选择
应用统计
2025-04-30 v3
摘要
我们提出一种基于重采样的快速变量选择技术,用于在多标记混合效应模型中检测相关的单核苷酸多态性(SNP)。由于计算复杂性,当前实践主要涉及一种一次检测一个SNP效应的做法,通常称为“单SNP关联分析”。对基因或通路内遗传变异的联合建模可能具有更好的功效来检测相关遗传变异,尤其是效应较弱者。在本文中,我们提出一种计算高效的模型选择方法——基于e-values框架——用于在家系中同时利用多个SNP的信息进行单SNP检测。为克服传统模型选择方法的计算瓶颈,我们的方法训练单一模型,并利用一种快速可扩展的bootstrap过程。我们通过数值研究说明,我们提出的方法在检测与某一性状相关的SNP方面,比使用家系数据的单标记分析或忽略家系依赖结构的模型选择方法都更有效。此外,我们使用我们的方法在明尼苏达双胞胎与家庭研究中心(MCTFR)数据集上进行基因水平分析,借此检测出若干已被指称与酒精消费相关的SNP。
引用
@article{arxiv.1802.01141,
title = {Simultaneous Selection of Multiple Important Single Nucleotide Polymorphisms in Familial Genome Wide Association Studies Data},
author = {Subhabrata Majumdar and Saonli Basu and Matt McGue and Snigdhansu Chatterjee},
journal= {arXiv preprint arXiv:1802.01141},
year = {2025}
}
备注
Published in Scientific Reports