RISED:面向临床 AI 决策支持系统的部署前安全评估框架
摘要
聚合准确率指标主导临床 AI 决策支持系统的评估,但无法检测输入可靠性、子群公平性、阈值灵敏性或操作可行性等部署阶段故障。我们提出 RISED 框架:一个覆盖可靠性、包容性、灵敏性、公平性和可部署性五个维度的部署前评估框架,其中每个维度通过形式化子准则、预先规定的通过/失败阈值,以及偏差校正加速(BCa)自助置信区间组合,经 Holm-Bonferroni 家族误差校正后实施。核心演示表明,一个在常规高辨识基准下通过的分类器,可能同时失败于输入编码稳定性和阈值漂移灵敏性检查,而子群 AUC 平等性则在统计上难以得出结论,这揭示了聚合评估alone 无法检测到的部署风险。我们在合成队列和三个公开的真实队列上进行了验证,这些队列跨越 35 年的临床数据时代,从 1980 年代的心脏病数据集到 2024 年的全国代表性健康调查,其中失败维度因队列而异,提供了构建有效性的初步证据。公平性维度被重新框定为代理依赖诊断,而非独立门槛:任何针对利用派生代理计算的基于需求的公平判断,都包含构建有效性问题,该框架会显式地暴露这一问题,触发对 outcome-independent need measure 的采购要求,只有在此之前该门槛才具备约束力。RISED 以开源 Python 软件包形式发布,提供临床 AI 报告标准所要求的定量判断,为体内模型验证与静默试验临床评估之间提供原则性的门户。
引用
@article{arxiv.2605.12895,
title = {RISED: A Pre-Deployment Safety Evaluation Framework for Clinical AI Decision-Support Systems},
author = {Rohith Reddy Bellibatlu},
journal= {arXiv preprint arXiv:2605.12895},
year = {2026}
}
备注
Submission to Artificial Intelligence in Medicine (Elsevier). Open-source Python implementation at https://github.com/rohithreddybc/rised-healthcare-eval (MIT license). Synthetic evaluation cohort at https://huggingface.co/datasets/Rohithreddybc/rised-healthcare-eval-dataset (DOI: 10.57967/hf/8734)