高维相关数据中未观测协变量的估计与校正
统计方法学
2018-08-20 v1
摘要
许多高维与高通量生物数据集具有复杂的样本相关结构,包括纵向与多组织数据,以及具有多种处理条件或相关个体的数据。这些数据和几乎所有高通量“组学”数据都受到研究者未知的技术与生物因素影响,若不加考虑,会严重混淆由已知关注协变量所致效应的估计与推断。因此我们开发了CBCV与CorrConf:可证明准确且计算高效的方法,用于选择高维相关或不可交换残差数据中潜在混杂因子的数目并对其进行估计。我们通过分析模拟多组织基因表达数据以及在真实纵向双胞胎研究中识别性别相关DNA甲基化位点,展示了各方法优于其他SOTA方法的性能。据我们所知,这些是首批能在相关或不可交换残差数据中估计潜在混杂因子数目并对其进行校正的方法。R包可从 https://github.com/chrismckennan/CorrConf 下载。
引用
@article{arxiv.1808.05895,
title = {Estimating and accounting for unobserved covariates in high dimensional correlated data},
author = {Chris McKennan and Dan Nicolae},
journal= {arXiv preprint arXiv:1808.05895},
year = {2018}
}
备注
22 slides (54 including the supplement), 3 tables, 3 figures