面向不完整临床数据的可信决策机器学习框架:特征稳定性与可解释性
机器学习
2026-02-20 v1 人工智能
摘要
机器学习模型正在逐渐应用于生物医学数据,但由于其鲁棒性差、可解释性有限以及在数据扰动(如缺失)情况下的特征学习不稳定性问题,仍难以在高风险领域广泛采用。特别是,尽管某些模型在预测性能上表现出色,但若其关键特征在数据完整性变化时波动,仍可能丧失信任,削弱可重复性和后续决策能力。本文提出CACTUS(Comprehensive Abstraction and Classification Tool for Uncovering Structures),一种专为解决小规模、异构且不完整临床数据集中的上述挑战而设计的可解释机器学习框架。CACTUS集成了特征抽象、可解释分类和系统性特征稳定性分析,量化在数据质量恶化时,关键特征保持信息量的稳定性。我们以一个包含568名患者的血尿症队列为例,对CACTUS在受控随机缺失数据水平下进行基准测试,与随机森林和梯度提升等常用机器学习方法进行比较。结果表明,CACTUS在保持显著更高特征稳定性的同时,达到或超越了传统方法的预测性能,包括在按性别分层的分析中。我们的研究表明,特征稳定性提供的信息补充了常规性能指标,对评估生物医学数据中机器学习模型的可信度至关重要。通过显式量化对缺失数据的鲁棒性并优先选择可解释且稳定的特征,CACTUS为面向可信数据驱动决策支持提供了一个通用框架。
引用
@article{arxiv.2602.17364,
title = {A feature-stable and explainable machine learning framework for trustworthy decision-making under incomplete clinical data},
author = {Justyna Andrys-Olek and Paulina Tworek and Luca Gherardini and Mark W. Ruddock and Mary Jo Kurt and Peter Fitzgerald and Jose Sousa},
journal= {arXiv preprint arXiv:2602.17364},
year = {2026}
}