中文

正规化、非差异表达基因与数据来源与机器学习在转录组和临床数据内/跨数据集建模中的表现关联

定量方法 2025-02-28 v2 统计方法学

摘要

跨数据集测试是检验机器学习(ML)模型性能的关键。然而,大多数针对转录组和临床数据建模的研究仅进行内数据集测试。此外,正规化和非差异表达基因(NDEG)是否能提高跨数据集建模性能尚不明确。因此,我们旨在理解正规化、NDEG 和数据来源是否与 ML 在跨数据集测试中的性能相关。使用来自 TCGA 和 ONCOSG 中肺腺癌病例的转录组和临床数据。最佳的跨数据集 ML 性能是仅使用转录组数据实现的,且优于使用转录组和临床数据的性能。在 TCGA 训练、ONCOSG 测试的 ML 算法的平均准确率、ROC 曲线下面积和准确率显著优于相反情况(p<0.05)。正规化和 NDEG 在两个数据集中均显著提高了内数据集 ML 性能,但在跨数据集测试中并未见效。令人惊讶的是,仅使用 ONCOSG 的转录组数据建模的表现优于同时使用转录组和临床数据的建模,而在 TCGA 中纳入临床数据并未显著影响 ML 性能,这表明临床数据的价值有限或 TCGA 中的转录组数据影响占主导。内数据集测试中的性能提升在训练 ONCOSG 的 ML 模型时更为显著。对于比较的六种 ML 模型,支持向量机在内数据集和跨数据集测试中最常表现为最佳方案。因此,我们的数据表明数据来源、正规化和 NDEG 与在转录组和临床数据建模中的内数据集和跨数据集 ML 性能相关。

关键词

引用

@article{arxiv.2502.18888,
  title  = {Association of normalization, non-differentially expressed genes and data source with machine learning performance in intra-dataset or cross-dataset modelling of transcriptomic and clinical data},
  author = {Fei Deng and Lanjing Zhang},
  journal= {arXiv preprint arXiv:2502.18888},
  year   = {2025}
}