中文

用于正常胸片诊断的人工智能方案的鲁棒性

图像与视频处理 2022-09-20 v1 人工智能

摘要

目的:用于医学诊断的人工智能(AI)方案需要经过严格评估,以证明其在所有患者亚组中的性能得以保持,并确保所提出的诊疗改进能够公平地惠及各方。本研究通过比较多个患者与环境亚组间的性能,并将 AI 错误与人类专家所犯错误进行对比,评估了一种用于正常胸部 X 光片(CXR)诊断的 AI 方案的鲁棒性。方法:共抽取 4,060 张 CXR,以代表 NHS 患者与诊疗环境的多样化数据集。金标准标签由三位放射科医师小组标定。AI 性能依据所标定标签进行评估,并针对患者年龄、性别,以及 CXR 视图、模态、设备厂商与医院站点开展亚组分析。结果:该 AI 方案通过将 18.5% 的数据集分类为高分置信正常(HCN)而将其剔除。其阴性预测值(NPV)为 96.0%,而放射科医师对正常扫描的诊断 NPV 为 89.1%。在所有 AI 假阴性(FN)病例中,与最终金标准标签比对发现,亦有放射科医师犯了相同错误。亚组分析显示 AI 性能无统计学显著变异,但在部分医院站点的数据中观察到正常分类减少。结论:我们表明该 AI 方案可将 18.5% 的扫描诊断为 HCN,且 NPV 优于人类阅片者,从而提供有意义的工作量减少。该 AI 方案在各患者亚组中均表现良好,且错误病例本质上为主观性或细微性。

关键词

引用

@article{arxiv.2209.09204,
  title  = {Robustness of an Artificial Intelligence Solution for Diagnosis of Normal Chest X-Rays},
  author = {Tom Dyer and Jordan Smith and Gaetan Dissez and Nicole Tay and Qaiser Malik and Tom Naunton Morgan and Paul Williams and Liliana Garcia-Mondragon and George Pearse and Simon Rasalingham},
  journal= {arXiv preprint arXiv:2209.09204},
  year   = {2022}
}