虚拟成像试验方法学在人工智能系统与训练数据客观表征中的效用
图像与视频处理
2026-02-18 v6 机器学习
摘要
目的:用于医学影像的人工智能(AI)模型的可信度仍是一项挑战,受模型多样性、用于训练模型的数据以及二者组合在新数据上产生可复现结果的适用性所影响。本工作旨在探索新兴的虚拟成像试验(VIT)方法学是否能提供客观资源以应对该挑战。方法:研究以 COVID-19 诊断为案例,使用经卷积神经网络处理的临床与虚拟计算机断层扫描(CT)和胸部 X 线摄影(CXR)进行。利用 3D ResNet 类与 2D EfficientNetv2 架构在多个数据集上开发并测试了多种 AI 模型。结果:使用曲线下面积(AUC)和 DeLong 方法计算 AUC 置信区间来评估模型性能。在最具多样性数据集上训练的模型展现出最高的外部测试性能,CT 的 AUC 值为 0.73–0.76,CXR 为 0.70–0.73。内部测试得出更高的 AUC 值(CT 为 0.77–0.85,CXR 为 0.77–1.0),凸显了外部验证中性能的显著下降,这强调了多样且全面的训练与测试数据的重要性。最值得注意的是,VIT 方法提供了对多样模型与数据集效用的客观评估,同时揭示了数据集特征、患者因素和成像物理对 AI 效能的影响。结论:VIT 方法增强了模型的透明性与可靠性,对驱动 AI 性能的因素提供了细致洞察,并弥合了实验与临床环境之间的鸿沟。
引用
@article{arxiv.2308.09730,
title = {The Utility of the Virtual Imaging Trials Methodology for Objective Characterization of AI Systems and Training Data},
author = {Fakrul Islam Tushar and Lavsen Dahal and Saman Sotoudeh-Paima and Ehsan Abadi and W. Paul Segars and Ehsan Samei and Joseph Y. Lo},
journal= {arXiv preprint arXiv:2308.09730},
year = {2026}
}
备注
8 figures, 4 Tables, 1 Supplement