中文

AI CADe 息肉检测器泛化至新国家的非凡有效性

机器学习 2023-12-19 v2 人工智能 计算机视觉与模式识别 计算机与社会

摘要

背景与目的\textbf{背景与目的}:人工智能(AI)计算机辅助检测(CADe)常用于息肉检测,但临床环境中的数据可能与模型训练数据不同。很少有研究评估 CADe 检测器在训练期间未见过的国家结肠镜检查中的表现,且在不收集昂贵且耗时的标签的情况下,均无法评估其性能。方法\textbf{方法}:我们在以色列结肠镜检查视频(5004 个视频,1106 小时)上训练了一个 CADe 息肉检测器,并通过测量真阳性率(TPR)与每分钟误报率(FAPM)的关系,在日本视频(354 个视频,128 小时)上进行了评估。我们引入了一种称为“掩码医学嵌入距离”(MACE)的结肠镜检查差异度量,以在无标签的情况下量化结肠镜检查之间的差异。我们在所有日本视频以及具有最高 MACE 的视频上评估了 CADe。结果\textbf{结果}:MACE 正确量化了窄带成像(NBI)和色素内镜(CE)帧与以色列数据的相似度低于日本白光帧(自助法 z 检验,两者 |z| > 690,p < 10810^{-8})。尽管数据存在差异,在无需额外训练的情况下,CADe 在日本结肠镜检查上的表现并不劣于以色列(0.5 FAPM 下的 TPR:以色列和日本分别为 0.957 和 0.972;1.0 FAPM 下的 TPR:以色列和日本分别为 0.972 和 0.989;优效性检验 t > 45.2,p < 10810^{-8})。尽管未在 NBI 或 CE 上进行训练,但这些子集上的 TPR 并不劣于日本整体(非劣效性检验 t > 47.3,p < 10810^{-8},两者 δ\delta = 1.5%)。结论\textbf{结论}:阻碍 CADe 检测器在非医疗环境中良好表现的数据差异,并未降低我们的 AI CADe 息肉检测器应用于新国家数据时的性能。MACE 可以通过识别最“不相似”的数据来评估模型,从而帮助医疗 AI 模型实现国际化。

关键词

引用

@article{arxiv.2312.06833,
  title  = {The unreasonable effectiveness of AI CADe polyp detectors to generalize to new countries},
  author = {Joel Shor and Hiro-o Yamano and Daisuke Tsurumaru and Yotami Intrator and Hiroki Kayama and Joe Ledsam and Atsushi Hamabe and Koji Ando and Mitsuhiko Ota and Haruei Ogino and Hiroshi Nakase and Kaho Kobayashi and Eiji Oki and Roman Goldenberg and Ehud Rivlin and Ichiro Takemasa},
  journal= {arXiv preprint arXiv:2312.06833},
  year   = {2023}
}