使用多视图特征选择方法与集成分类器的泛癌症分类模型
机器学习
2025-01-14 v1 基因组学
摘要
准确识别癌症样本对于精确诊断和有效的患者治疗至关重要。传统方法在处理高维和高特征样本比时存在困难,而这对于癌症样本分类至关重要。本研究旨在开发一个专门针对转录组数据的新型特征选择框架,并提出两种集成分类器。在特征选择方面,我们根据特征类型对转录组数据集进行垂直划分。然后对每个划分应用 Boruta 特征选择过程,合并结果,并再次对合并后的结果应用 Boruta。我们使用不同的 Boruta 参数重复该过程,并准备最终的特征集。最后,我们基于 LR、SVM 和 XGBoost 分类器,结合最大投票和平均概率方法构建了两种集成机器学习模型。我们使用 10 折交叉验证来确保稳健可靠的分类性能。我们的方法达到了 97.11% 的准确率和 0.9996 的 AUC 值,与现有的 SOTA 方法相比,在分类 33 种癌症类型时表现更优。由于组织来源的相似性,传统上很难区分一组 12 种癌症。我们的方法准确识别了这 12 种癌症中超过 90% 的样本,优于现有文献中提出的所有已知方法。基因集富集分析表明,我们框架选择的特征富集了与癌症高度相关的通路。本研究开发了一个特征选择框架,用于选择与癌症发展高度相关的特征,从而以更高的准确率识别不同类型的癌症样本。
引用
@article{arxiv.2501.06805,
title = {A Pan-cancer Classification Model using Multi-view Feature Selection Method and Ensemble Classifier},
author = {Tareque Mohmud Chowdhury and Farzana Tabassum and Sabrina Islam and Abu Raihan Mostofa Kamal},
journal= {arXiv preprint arXiv:2501.06805},
year = {2025}
}
备注
20 pages, 5 figures, 9 tables