SUDO:一个无需真值标注的临床人工智能系统评估框架
机器学习
2024-03-27 v1 人工智能
计算机与社会
摘要
临床人工智能(AI)系统通常在一个其之前未接触过的留出数据集(例如,来自具有不同电子健康记录系统的不同医院的数据)上进行验证。此评估过程旨在模拟 AI 系统在野外数据上的部署;这些数据目前对系统而言是未见的,但预计会在临床环境中遇到。然而,当野外数据与留出数据集不同(这种现象被称为分布偏移)且缺乏真值标注时,基于 AI 的发现在野外数据上的可信度就变得不清楚了。在此,我们引入了 SUDO,一个在无真值标注下评估 AI 系统的框架。SUDO 为野外数据点分配临时标签,并直接使用它们来训练不同的模型,其中表现最佳的模型指示了最可能的标签。通过在为皮肤病学图像、组织病理学切片和临床报告开发的 AI 系统上进行的实验,我们表明 SUDO 可以作为模型性能的可靠代理,从而识别不可靠的预测。我们还证明,SUDO 能为模型选择提供信息,并允许对以前无法触及的、无真值标注的野外数据的算法偏差进行评估。对不可靠的预测进行分流以供进一步检查并评估 AI 系统的算法偏差的能力,可以提高研究发现的完整性,并有助于在医学中部署符合伦理的 AI 系统。
引用
@article{arxiv.2403.17011,
title = {SUDO: a framework for evaluating clinical artificial intelligence systems without ground-truth annotations},
author = {Dani Kiyasseh and Aaron Cohen and Chengsheng Jiang and Nicholas Altieri},
journal= {arXiv preprint arXiv:2403.17011},
year = {2024}
}