面向AI驱动数字健康的统计学有效后部署监控应被视为标准做法
机器学习
2026-02-06 v3
摘要
本立场论文认为,临床AI的后部署监控发展不足,并提出基于统计学有效性和标签高效性的测试框架,作为确保实际部署中可靠性与安全性的原则性基础。近期审查发现,仅有9%的FDA注册AI类医疗工具包含后部署监控计划。现有监控方法往往是手动的、间歇性的和被动的,难以适应临床模型所处的动态环境。我们认为,后部署监控应建立在标签高效且统计学有效的测试框架之上,这为当前做法提供了原则性替代方案。我们使用“统计学有效”一词,指方法能够对错误率(如I型/II型误差)提供明确保证,支持在预定义假设下进行形式推断,并支持可重复性——这些特征与监管要求相吻合。具体而言,我们提出,数据变化和模型性能退化的检测应被建构为独立的统计假设检验问题。将监控置于统计严谨性基础上,确保了临床AI系统可靠性的可重复性和科学性。重要的是,这也为技术社区开辟了新的研究方向——涵盖理论、方法及工具,用于在实际场景中对后部署模型故障进行统计原则性的检测、归因与缓解。
引用
@article{arxiv.2506.05701,
title = {Statistically Valid Post-Deployment Monitoring Should Be Standard for AI-Based Digital Health},
author = {Pavel Dolin and Weizhi Li and Gautam Dasarathy and Visar Berisha},
journal= {arXiv preprint arXiv:2506.05701},
year = {2026}
}