中文

基于自编码器和生成对抗网络的方法处理多组学数据中的不平衡类别问题与分类

机器学习 2024-05-17 v1 神经与进化计算 基因组学

摘要

在提升医学诊断效率的努力中,集成最新机器学习方法的研究日益成为一个有前景的研究领域。分子生物学中,随着多组学测序技术的发展,产生的数据量呈指数级增长。这些新兴测序设备能够为单个实验提供大量复杂的测量数据。因此,面对如此高维数据,传统的统计方法面临巨大挑战。然而,这些数据集包含的大部分信息是冗余或无关的,能够通过显著减少变量数量而不损失太多信息来有效降维。降维技术是一系列数学程序,允许完成这种降维;它们主要通过统计学和机器学习领域的发展而形成。医学数据集的另一个挑战是类别样本数量不平衡,这会导致机器学习模型产生偏倚结果。本研究聚焦于解决神经网络中包含自编码器用于提取特征潜在空间,以及生成对抗网络用于生成合成样本的挑战。潜在空间是捕捉原始数据有意义特征的降维空间。我们的模型首先进行特征选择,以选择判别性特征后输入神经网络。随后,模型对不同数据集的癌症结果进行预测。该模型在尿瘤数据集上取得95.09%的准确率,在乳腺癌数据集上取得88.82%的准确率,优于其他现有模型。

关键词

引用

@article{arxiv.2405.09756,
  title  = {An Autoencoder and Generative Adversarial Networks Approach for Multi-Omics Data Imbalanced Class Handling and Classification},
  author = {Ibrahim Al-Hurani and Abedalrhman Alkhateeb and Salama Ikki},
  journal= {arXiv preprint arXiv:2405.09756},
  year   = {2024}
}