基于机器学习的多组学数据集成用于肝细胞癌早期诊断
机器学习
2025-04-18 v1 人工智能
摘要
来自不同患者数据的互补信息有助于更准确地建模患者的疾病状态,并更好地理解疾病的 underlying 生物过程。然而,分析多模态、多组学数据 presents many 挑战,包括高维度、不同模态之间的尺度、统计分布和信噪比差异。本文比较了各种集成机器学习算法的性能,这些算法能够对来自不同模态的多类数据进行晚期集成。测试的集成方法及其变体包括:i) 投票集成,包含硬投票和软投票;ii) 元学习器;iii) 基于硬投票、软投票和元学习器的多模态Adaboost模型,即PB-MVBoost模型;以及一种新颖的混合专家模型应用。这些方法与简单拼接作为基线进行比较。我们使用来自内部分析的肝细胞癌(HCC)数据,以及来自乳腺癌和肠易激综合征(IBD)研究的四个验证数据集进行测试。采用受试者工作曲线下面积(AUC)作为性能衡量标准,我们开发的模型最高可达0.85的性能值,发现两种提升方法,PB-MVBoost和使用软投票的Adaboost,整体表现最佳。我们还检查了特征选择的稳定性以及临床特征签名的大小。最后,我们提供了关于集成多模态多类数据的最佳实践建议。
关键词
引用
@article{arxiv.2409.13791,
title = {Multi-omics data integration for early diagnosis of hepatocellular carcinoma (HCC) using machine learning},
author = {Annette Spooner and Mohammad Karimi Moridani and Azadeh Safarchi and Salim Maher and Fatemeh Vafaee and Amany Zekry and Arcot Sowmya},
journal= {arXiv preprint arXiv:2409.13791},
year = {2025}
}
备注
21 pages, 5 figures