可解释机器学习与线性回归预测美国县级肺癌死亡率的比较评估
机器学习
2025-12-23 v1 人工智能
应用统计
摘要
肺癌是美国癌症相关死亡的主要原因。准确预测肺癌死亡率对于指导有针对性的干预措施和解决健康差异至关重要。尽管传统的基于回归的模型已被普遍使用,但可解释的机器学习模型可能提供更高的预测精度,并更深入地洞察影响肺癌死亡率的因素。本研究应用了三种模型:随机森林(RF)、梯度提升回归(GBR)和线性回归(LR)来预测美国各县的肺癌死亡率。使用 R 平方和均方根误差(RMSE)评估模型性能。使用 Shapley Additive Explanations(SHAP)值来确定变量重要性及其方向性影响。通过 Getis-Ord(Gi*)热点分析分析了肺癌死亡率的地理差异。RF 模型的表现优于 GBR 和 LR,达到了41.9%的 R² 值和12.8的 RMSE。SHAP 分析确定吸烟率是最重要的预测因子,其次是房屋价值中位数和西班牙裔族群人口百分比。空间分析揭示了美国中东部各县存在显著的肺癌高死亡率聚集区。RF 模型在预测肺癌死亡率方面表现出优越的性能,强调了吸烟率、房屋价值和西班牙裔族群人口百分比的关键作用。这些发现为在美国受肺癌影响最严重的地区设计有针对性的干预措施、促进筛查和解决健康差异提供了有价值的可操作见解。
引用
@article{arxiv.2512.17934,
title = {Comparative Evaluation of Explainable Machine Learning Versus Linear Regression for Predicting County-Level Lung Cancer Mortality Rate in the United States},
author = {Soheil Hashtarkhani and Brianna M. White and Benyamin Hoseini and David L. Schwartz and Arash Shaban-Nejad},
journal= {arXiv preprint arXiv:2512.17934},
year = {2025}
}
备注
9 Pages, 4 Figures, 1 Table