中文

基于自编码器的整合多组学数据嵌入及其混杂因素校正

应用统计 2021-03-30 v2 机器学习

摘要

在组学数据的整合分析中,常需从一种数据类型中提取最能反映其与另一数据类型关系的数据表示。该任务传统上由典型相关分析(CCA)与偏最小二乘(PLS)等线性方法完成。然而,一种数据类型中关涉另一数据类型的信息可能复杂且呈非线性形式。深度学习为提取低维非线性数据嵌入提供了便捷的替代方案。此外,深度学习框架可自然地将临床混杂因素的影响纳入整合分析。在此我们报告一种名为基于自编码器的整合多组学数据嵌入(AIME)的深度学习框架,用于提取组学数据整合分析的数据表示。该方法可校正混杂变量、实现信息性数据嵌入、按贡献对特征排序,并通过数据嵌入找出两数据类型间相互关联的特征对。在模拟研究中,该方法在提取数据类型间主要贡献特征上极为有效。利用真实microRNA–基因表达数据集与真实DNA甲基化–基因表达数据集,我们展示了AIME排除了包括批次效应在内的混杂因素影响,并提取出生物学上合理的新信息。基于Keras与TensorFlow后端的R包见 https://github.com/tianwei-yu/AIME。

关键词

引用

@article{arxiv.1906.07800,
  title  = {Autoencoder-based integrative multi-omics data embedding that allows for confounder adjustments},
  author = {Tianwei Yu},
  journal= {arXiv preprint arXiv:1906.07800},
  year   = {2021}
}

备注

20 pages, 5 figure