中文

结直肠癌风险预测模型特征选择的比较研究

机器学习 2024-02-09 v1 人工智能

摘要

背景与目标 风险预测模型旨在识别患目标疾病风险较高的人群。特征选择对于提高预测模型性能、避免过拟合以及识别主要的癌症风险(和保护)因素尤为重要。当目标是分析具有更强预测能力的特征时,评估特征选择/排序算法的稳定性成为一个重要问题。方法 本研究聚焦于结直肠癌,评估了多种特征排序算法在一组风险预测模型(神经网络、支持向量机(SVM)、逻辑回归、k-最近邻和提升树)上的性能。此外,遵循传统方法使用标量稳定性指标,并结合本研究提出的一种可视化方法,评估了它们的鲁棒性,以研究特征排序技术之间的相似性及其各自的稳定性。对在本研究中发现的最相关特征与专家根据最新知识提供的特征进行了比较分析。结果 在ROC曲线下面积(AUC)方面,两个最佳性能结果分别是:使用SVM包装器方法选择的前41个特征的SVM分类器(AUC=0.693),以及使用皮尔逊相关系数选择的前40个特征的逻辑回归(AUC=0.689)。实验表明,与使用全部特征集的结果相比,进行特征选择使SVM和逻辑回归分类器的AUC分别提高了3.9%和1.9%。本文提出的可视化方法表明,基于神经网络的包装器排序最不稳定,而随机森林最稳定。

关键词

引用

@article{arxiv.2402.05293,
  title  = {A comparative study on feature selection for a risk prediction model for colorectal cancer},
  author = {N. Cueto-López and M. T. García-Ordás and V. Dávila-Batista and V. Moreno and N. Aragonés and R. Alaiz-Rodríguez},
  journal= {arXiv preprint arXiv:2402.05293},
  year   = {2024}
}