利用生存数据的机器学习模型计算与解释变量相关的风险比
机器学习
2021-04-06 v1 定量方法
摘要
目的:Cox 比例风险(CoxPH)模型在生存数据上的应用以及风险比(HR)的推导已十分成熟。虽然非线性、基于树的机器学习(ML)模型已被开发并应用于生存分析,但尚不存在从此类模型计算与解释变量相关的 HR 的方法。我们描述了一种利用 Shapley 加性解释(SHAP)值从基于树的 ML 模型计算 HR 的新方法,SHAP 值是一种局部准确且一致的方法,用于量化解释变量对预测的贡献。方法:我们使用了三组公开可用的生存数据,包括结肠癌、乳腺癌或泛癌患者,并将 CoxPH 与最先进的 ML 模型 XGBoost 的性能进行比较。为从 XGBoost 模型计算解释变量的 HR,将 SHAP 值取指数,并计算两个子组上均值之比。置信区间通过对训练数据自助采样并生成 1000 次 ML 模型得到。在这三组数据上,我们系统地比较了所有解释变量的 HR。分析中使用了 Python 和 R 中的开源库。结果:对于结肠癌和乳腺癌数据集,CoxPH 与 XGBoost 的性能相当,且我们计算的 HR 表现出良好的一致性。在泛癌数据集中,大多数变量结果一致,但 CoxPH 与 XGBoost 结果中两个解释变量存在相反发现。随后的 Kaplan-Meier 图支持了 XGBoost 模型的发现。结论:能够从 ML 模型推导 HR 有助于改进从复杂生存数据集中识别风险因素,并增强临床试验结果的预测。
引用
@article{arxiv.2102.00637,
title = {Computing the Hazard Ratios Associated with Explanatory Variables Using Machine Learning Models of Survival Data},
author = {Sameer Sundrani and James Lu},
journal= {arXiv preprint arXiv:2102.00637},
year = {2021}
}
备注
27 pages, 5 figures, 1 table