中文

分离与重整合潜变量以改进基因组数据分类

应用统计 2021-11-02 v2

摘要

基因组数据集除了包含主要感兴趣变量的效应外,还包含各种未观测生物变量的效应。这些潜变量通常影响大量特征(如基因),从而产生稠密潜变异,这既给分类带来挑战也带来机遇。其中一些潜变量可能与感兴趣表型部分相关因而有用,而另一些可能不相关从而仅贡献额外噪声。此外,无论潜在有用与否,这些潜变量可能掩盖仅影响少量特征但更直接捕获主要感兴趣信号的较弱效应。我们提出交叉残差化分类器以更好地考虑基因组数据中的潜变量。通过调整和集成过程,交叉残差化分类器本质上估计潜变量并残差化去除其效应,在残差上训练分类器,然后在最终集成分类器中重新整合潜变量。因此,在不丢弃它们可能贡献的任何预测信息的情况下考虑了潜变量。我们将该方法应用于模拟数据以及来自多个平台的多种基因组数据集。总体而言,我们发现交叉残差化分类器相对于现有分类器表现良好,且有时带来显著增益。

关键词

引用

@article{arxiv.2012.11757,
  title  = {Separating and reintegrating latent variables to improve classification of genomic data},
  author = {Nora Yujia Payne and Johann A. Gagnon-Bartsch},
  journal= {arXiv preprint arXiv:2012.11757},
  year   = {2021}
}