关于使用 Shapley 值通过 CATE 模型识别预测生物标志物的概述与实用建议
统计方法学
2025-05-05 v1 机器学习
摘要
近年来,机器学习领域涌现出两大并行研究趋势,却很少有交叉探讨。一方面,针对 Individual Treatment Effect(ITE)建模,尤其是针对 Conditional Average Treatment Effect(CATE)的 meta-learner 技术数量激增,旨在从观察性数据中识别因果效应。另一方面,可解释机器学习(XML)领域兴起,涌现出各种方法以解释复杂模型并提升可解释性。其中,Shapley 增益解释(SHAP)已成为数据科学中分析监督学习模型的主流技术。然而,如何将 SHAP 应用于通过 CATE 模型识别预测生物标志物方面仍鲜有探索,这在制药精准医学中具有关键意义。我们针对多阶段 CATE 策略中 SHAP 概念的内在挑战,提出一种对 CATE 策略选择agnostic 的代理估计方法,有效降低了高维数据的计算负担。通过该方法,我们进行仿真基准测试,评估 various CATE meta-learner 和 Causal Forest 从不同方法派生的 SHAP 值在准确识别生物标志物方面的能力。
引用
@article{arxiv.2505.01145,
title = {Overview and practical recommendations on using Shapley Values for identifying predictive biomarkers via CATE modeling},
author = {David Svensson and Erik Hermansson and Nikolaos Nikolaou and Konstantinos Sechidis and Ilya Lipkovich},
journal= {arXiv preprint arXiv:2505.01145},
year = {2025}
}