VALD-MD:基于潜在扩散模型的医学诊断视觉归因
图像与视频处理
2024-01-04 v1 机器学习
摘要
医学成像中的视觉归因旨在使医学图像中与诊断相关的成分显而易见,这与标准机器视觉流程中部署的更常见的病变组织检测形成对比(后者对临床医生而言不太容易解释/说明)。我们在此提出了一种新颖的生成式视觉归因技术,该技术利用潜在扩散模型(latent diffusion models)结合领域特定的大型语言模型,以生成异常图像的正常对应物。两者之间的差异因此产生了一个映射,指示出与诊断相关的图像成分。为了实现这一目标,我们部署了图像先验以及适当的条件机制来控制图像生成过程,包括从医学科学和应用放射学中获取的自然语言文本提示。我们在包含带有不同病理标记的胸部 X 光片的 COVID-19 放射摄影数据库上进行了实验,并通过真实图像与生成图像之间获得的 Fréchet Inception Distance (FID)、结构相似性 (SSIM) 和多尺度结构相似性度量 (MS-SSIM) 指标对结果进行了定量评估。所得系统还展现了一系列潜在能力,包括零样本局部疾病诱导,这些能力已通过 cheXpert 数据集中的真实示例进行了评估。
引用
@article{arxiv.2401.01414,
title = {VALD-MD: Visual Attribution via Latent Diffusion for Medical Diagnostics},
author = {Ammar A. Siddiqui and Santosh Tirunagari and Tehseen Zia and David Windridge},
journal= {arXiv preprint arXiv:2401.01414},
year = {2024}
}