中文

深度学习模型临床部署后的性能退化:以前列腺癌根治性放疗自动分割为例

图像与视频处理 2023-11-17 v2 计算机视觉与模式识别 应用统计

摘要

我们评估了基于深度学习(DL)的人工智能(AI)模型在前列腺癌放疗中自动分割的时间性能,试图将其效能与临床环境的变化相关联。本研究纳入了2006年1月至2022年8月在德克萨斯大学西南医学中心接受根治性放疗的1328名前列腺癌患者。我们在2006年至2011年的数据上训练了一个基于UNet的分割模型,并在2012年至2022年的数据上进行测试,以模拟真实世界的临床部署。我们使用Dice相似系数(DSC)衡量模型性能,并利用指数加权移动平均(EMA)曲线可视化轮廓质量趋势。此外,我们执行Wilcoxon秩和检验以分析不同时期DSC分布的差异,并采用多元线性回归研究各种临床因素的影响。该模型在初始阶段(2012年至2014年)对前列腺、直肠和膀胱的分割表现出峰值性能。然而,我们观察到2015年后前列腺和直肠的性能显著下降,而膀胱轮廓质量保持稳定。影响前列腺轮廓质量的关键因素包括医师勾画风格、多种水凝胶间隔物的使用、CT扫描层厚、MRI引导勾画以及静脉注射(IV)造影剂的使用。直肠轮廓质量受层厚、医师勾画风格和多种水凝胶间隔物使用等因素影响。膀胱轮廓质量主要受IV造影剂使用的影响。本研究凸显了在动态临床环境中维持AI模型性能一致性所面临的挑战,强调需要持续监测并更新AI模型,以确保其在患者照护中的持续有效性与相关性。

关键词

引用

@article{arxiv.2210.05673,
  title  = {Performance Deterioration of Deep Learning Models after Clinical Deployment: A Case Study with Auto-segmentation for Definitive Prostate Cancer Radiotherapy},
  author = {Biling Wang and Michael Dohopolski and Ti Bai and Junjie Wu and Raquibul Hannan and Neil Desai and Aurelie Garant and Daniel Yang and Dan Nguyen and Mu-Han Lin and Robert Timmerman and Xinlei Wang and Steve Jiang},
  journal= {arXiv preprint arXiv:2210.05673},
  year   = {2023}
}