对抗域适应实现 RNA-Seq 数据集之间的知识迁移
机器学习
2026-03-10 v1 基因组学
摘要
从 RNA 测序 (RNA-seq) 数据准确预测表型对于诊断、生物标志物发现和个性化医疗至关重要。深度学习模型已显示出超越经典机器学习方法的潜力,但其性能依赖于大型、准确标注的数据集。在转录组学中,这类数据集常受限,导致过拟合和泛化能力差。来自更大、更通用数据集的知识迁移可以缓解此问题。然而,在 RNA-seq 数据集之间迁移信息仍然具有挑战性,因为不同的数据预处理管道存在差异且目标表型不同。本研究提出一种基于深度学习的域适应框架,实现从大型通用数据集向小型数据集进行癌症类型分类的有效知识迁移。该方法通过联合优化分类和域对齐目标,学习域不变的潜在空间。为确保训练稳定和数据稀缺情景下的鲁棒性,该框架采用合适的正则化进行对抗式训练。探索了有监督和无监督两种变体,分别利用标注或未标注的目标样本。该框架在三个大型转录组数据集 (TCGA、ARCHS4、GTEx) 上进行评估,以衡量其在不同队列之间迁移知识的能力。实验结果表明,与非自适应基线方法相比,本方法在癌症和组织类型分类中持续提高分类准确率,尤其在数据稀缺的情况下效果显著。总体而言,本工作表明域适应是转录组学数据高效知识迁移的强大策略,使我们能够在数据受限条件下实现稳健的表型预测。
引用
@article{arxiv.2603.08062,
title = {Adversarial Domain Adaptation Enables Knowledge Transfer Across Heterogeneous RNA-Seq Datasets},
author = {Kevin Dradjat and Massinissa Hamidi and Blaise Hanczar},
journal= {arXiv preprint arXiv:2603.08062},
year = {2026}
}
备注
7 pages, 5 figures. Submitted to ECCB 2026