中文

MODIS:用于小规模和非配对数据的多组学数据集成

机器学习 2025-09-16 v2

摘要

计算生物学中的一个重要目标是高效地集成多组学数据。集成任务伴随着挑战:多组学数据最常是非配对的(需要对角线集成)、部分标记了关于生物条件的信息,并且在某些情况下,如罕见疾病,只有非常小的数据集可用。我们提出 MODIS,一个半监督框架,旨在解决这些特定挑战。为解决 very small 数据集的挑战,我们提出利用来自更大多组学数据库中包含的信息,通过在大型参考数据库和小型目标数据集上同时训练模型,有效地将 transfer learning 问题转化为带有类别不平衡的学习问题。MODIS 对非配对样本执行对角线集成,利用类别标签在类不平衡和数据稀缺的情况下对不同模态进行对齐。该体系结构结合了多个变分自编码器、一个类别分类器和一个对抗性训练的模态分类器。为确保训练稳定性,我们将正则化相对 GAN 损失适应于此环境。我们首先在合成数据集上验证 MODIS,以评估准确对齐所需的监督水平,并量化类别不平衡对预测性能的影响。随后,我们将方法应用于大型公开 TCGA 数据库,考虑 10 到 34 个类别(癌症类型和正常组织)。MODIS 表现出高预测准确率、在有限监督下的稳健性能以及对类别不平衡的稳定性。这些结果将 MODIS 定位为挑战性集成场景的有前景的解决方案,特别是样本数极少的对角线集成,典型于罕见疾病研究。代码可在 https://github.com/VILLOUTREIXLab/MODIS} 上获取。

关键词

引用

@article{arxiv.2503.18856,
  title  = {MODIS: Multi-Omics Data Integration for Small and unpaired datasets},
  author = {Daniel Lepe-Soltero and Thierry Artières and Anaïs Baudot and Paul Villoutreix},
  journal= {arXiv preprint arXiv:2503.18856},
  year   = {2025}
}