PISA:一种提供多种复杂度-性能权衡模型且设计上可解释的生存分析AI流水线
应用统计
2025-09-30 v1 人工智能
机器学习
摘要
生存分析是临床研究的核心,为患者预后、指导治疗决策和优化资源分配提供信息。准确的至事件发生时间预测不仅能提高生活质量,还能揭示影响临床实践的风险因素。这些模型要在医疗保健中发挥作用,可解释性至关重要:预测必须可追溯至患者特定特征,且风险因素应可识别,从而为临床医生和研究人员生成可操作的见解。传统生存模型通常无法捕捉非线性交互,而现代深度学习方法虽然强大,却因可解释性差而受限。我们提出了一种可解释生存分析流水线(Pipeline for Interpretable Survival Analysis, PISA)——该流水线提供多种权衡复杂度与性能的生存分析模型。通过多特征、多目标的特征工程,PISA将患者特征和至事件发生时间数据转化为多个生存分析模型,为生存预测任务提供有价值的见解。关键在于,每个模型都被转化为由 Kaplan-Meier 曲线支持的简单患者分层流程图,同时不牺牲性能。尽管 PISA 与模型无关,我们通过 Cox 回归和浅层生存树的应用展示了其灵活性,后者避免了比例风险假设。应用于两个临床基准数据集时,PISA 生成了可解释的生存模型和直观的分层流程图,同时实现了 SOTA 性能。重新审视先前的科室研究,进一步证明了其在真实世界临床研究中自动化生存分析工作流的能力。
引用
@article{arxiv.2509.22673,
title = {PISA: An AI Pipeline for Interpretable-by-design Survival Analysis Providing Multiple Complexity-Accuracy Trade-off Models},
author = {Thalea Schlender and Catharina J. A. Romme and Yvette M. van der Linden and Luc R. C. W. van Lonkhuijzen and Peter A. N. Bosman and Tanja Alderliesten},
journal= {arXiv preprint arXiv:2509.22673},
year = {2025}
}