中文

基于电子健康记录的心力衰竭预测中机器学习的因果可解释性

机器学习 2025-06-04 v1 计算机与社会 机器学习

摘要

临床变量在疾病预后中的重要性通常通过统计相关性或机器学习(ML)来解释。然而,这些变量的预测重要性可能并不代表它们与疾病之间的因果关系。本文使用心力衰竭(HF)患者队列的临床变量,以研究在统计和机器学习情境下获得的重要变量的因果可解释性。由于内在的回归建模,流行的因果发现方法严格假设因果变量和效应变量均为数值型且连续。本文提出了一种新的计算框架,以实现因果结构发现(CSD)并对二元疾病结局的混合类型(类别型、数值型、二元型)临床变量进行因果强度评分。在心力衰竭分类中,我们研究了三种特征类型之间的重要性排序关联:相关特征、对机器学习预测重要的特征以及因果特征。我们的结果表明,针对非线性因果关系的 CSD 建模比其线性对应方法更有意义。从非线性分类器(例如梯度提升树)获得的特征重要性与变量的因果强度高度相关,且不区分因果变量和效应变量。相关变量可能是心力衰竭的因,但很少被识别为效应变量。这些结果可用于为基于机器学习预测建模中重要的变量添加因果解释。

关键词

引用

@article{arxiv.2506.03068,
  title  = {Causal Explainability of Machine Learning in Heart Failure Prediction from Electronic Health Records},
  author = {Yina Hou and Shourav B. Rabbani and Liang Hong and Norou Diawara and Manar D. Samad},
  journal= {arXiv preprint arXiv:2506.03068},
  year   = {2025}
}

备注

4 figures