基于 TCGA-BRCA 基因表达数据的乳腺癌亚型分类中,特征维度超过模型复杂度
机器学习
2026-05-08 v1 基因组学
摘要
准确分类乳腺癌亚型对于诊断和治疗选择至关重要。然而,这类数据集以高维度和有限样本量为特征,给机器学习模型带来挑战。本研究评估了模型复杂度和特征选择对亚型分类性能的影响。使用 TCGA-BRCA 基因表达数据训练了 logistic 回归、随机森林和支持向量机(SVM)模型,使用 50 到 20,518 个高度可变基因。使用分层 5 折交叉验证评估性能,并以准确率和宏 F1 分数衡量。虽然所有模型均实现了高准确率,但宏 F1 分析揭示了亚型层面性能的显著差异。Logistic 回归表现出最稳定、均衡的亚型性能,包括改进对稀有类的检测。随机森林在少数亚型上表现不佳,尽管整体准确率很高,而 SVM 对特征维度敏感。这一发现凸显了在高维生物分类任务中模型简单性、评估指标和特征选择的重要性。
引用
@article{arxiv.2605.06562,
title = {Feature Dimensionality Outweighs Model Complexity in Breast Cancer Subtype Classification Using TCGA-BRCA Gene Expression Data},
author = {Meena Al Hasani},
journal= {arXiv preprint arXiv:2605.06562},
year = {2026}
}
备注
8 pages, 4 figures, 3 tables. Independent research study using TCGA-BRCA RNA-seq data