基于集成岭回归与随机森林的类别型基因组数据分析中的变量选择与缺失数据插补
统计方法学
2021-11-11 v1 应用统计
摘要
全基因组关联研究(GWAS)产生的基因组数据往往不仅规模庞大,而且不完整。其不完整的一种特定形式为具有不可忽略缺失机制(non-ignorable missingness mechanism)的缺失值。基因组数据固有的复杂性,给开发一种无偏且信息丰富的、通过统计变量选择方法进行表型-基因型关联分析的程序带来了显著挑战。本文中,我们针对 GWAS 数据中存在不可忽略缺失机制缺失值的情况,通过集成用于变量选择的随机森林前沿方法、用于缺失数据插补的带 EM 算法的加权岭回归,以及用于判定缺失机制的线性统计假设检验,开发了一种连贯的类别型表型-基因型关联分析程序。两个模拟的 GWAS 被用于验证所提程序的性能。随后将该程序应用于分析一个来自乳腺癌 GWAS 的真实数据集。
引用
@article{arxiv.2111.05714,
title = {variable selection and missing data imputation in categorical genomic data analysis by integrated ridge regression and random forest},
author = {Siru Wang and Guoqi Qian},
journal= {arXiv preprint arXiv:2111.05714},
year = {2021}
}