基因组学研究中预测分析对高度相关基因的处理
应用统计
2022-04-11 v4 机器学习
摘要
背景:筛选特征基因以预测表型是基因组数据分析中的典型任务之一。尽管已开发了许多通用预测算法,预测模型中高度相关基因的处理仍未被很好解决。基因间的高相关性带来技术问题,如多重共线性问题,导致预测模型不可靠。此外,当一个因果基因(其变异对表型具有实际生物学效应)与其他基因高度相关时,大多数算法以纯粹数据驱动的方式从相关组中选择特征基因。由于基因间的相关结构在条件改变时可能大幅变化,基于未正确选择的特征基因的预测模型是不可靠的。因此,我们旨在将因果生物学信号保留在预测过程中,并构建更稳健的预测模型。方法:我们提出一种分组算法,将高度相关基因视为一组,并在特征选择中用其共同模式表示该组的生物学信号。我们的新颖分组算法可集成到现有预测算法中以增强其预测性能。我们提出的分组方法有两个优势。第一,使用基因组的共同模式使预测在条件变化下更稳健可靠。第二,它将整个相关基因组作为发现的生物标志物用于预测任务,使研究者能开展后续研究以在已识别组内定位因果基因。结果:使用带有模拟细胞表型的真实基准 scRNA-seq 数据集,我们证明新方法有显著优于标准模型的表现,体现在 (1) 细胞表型预测与 (2) 特征基因选择两方面。
引用
@article{arxiv.2007.02455,
title = {Handling highly correlated genes in prediction analysis of genomic studies},
author = {Li Xing and Songwan Joun and Kurt Mackay and Mary Lesperance and Xuekui Zhang},
journal= {arXiv preprint arXiv:2007.02455},
year = {2022}
}
备注
9 pages, 2 figures