从未筛选图像与报告中自监督多模态训练实现放射学中的零样本监督人工智能
图像与视频处理
2023-04-13 v4 计算与语言
计算机视觉与模式识别
机器学习
摘要
监督 AI 是放射学中一个新兴概念,其中 AI 通过持续支持放射科医生的决策过程而与之形成共生关系。视觉-语言模型的最新进展为理解视觉与文本概念及其语义对应关系,从而照亮了监督 AI 长期存在的问题。然而,视觉-语言模型在医学领域的应用成功有限,因为当前的视觉-语言模型及针对照片图像与字幕的学习策略需要网络规模的图文对语料库,而这在医学领域往往不可行。为此,我们提出一个名为医学交叉注意力视觉-语言模型(Medical X-VL)的模型,利用为医学领域量身定制的关键组件。我们的 Medical X-VL 模型基于以下组件:医学领域自监督单模态模型与融合编码器以桥接二者、动量蒸馏、面向医学报告的句子级对比学习,以及句子相似度调整的难负样本挖掘。我们通过实验证明,我们的模型可实现监督 AI 的多种零样本任务,从零样本分类到零样本纠错。我们的模型在两个不同的医学图像数据库中优于当前最先进模型,表明我们的监督 AI 模型在监测人为错误方面具有新的临床用途。我们的方法尤其在数据有限的环境中表现出色,而这是临床中经常遇到的情况,提示其在医学领域潜在的广泛适用性。
引用
@article{arxiv.2208.05140,
title = {Self-supervised Multi-modal Training from Uncurated Image and Reports Enables Zero-shot Oversight Artificial Intelligence in Radiology},
author = {Sangjoon Park and Eun Sun Lee and Kyung Sook Shin and Jeong Eun Lee and Jong Chul Ye},
journal= {arXiv preprint arXiv:2208.05140},
year = {2023}
}