DeViDe:用于改进医学视觉-语言预训练的分面医学知识
计算机视觉与模式识别
2024-04-05 v1
摘要
医学视觉-语言预训练对于胸部 X 光图像已取得显著进展,主要是利用配对的放射图和放射学报告。然而,现有方法常面临有效编码医学知识的挑战。虽然放射学报告提供了关于当前疾病表现的见解,但医学定义(如当代方法所用)往往过于抽象,导致知识鸿沟。为此,我们提出 DeViDe,一种新型基于转换器的方法,利用来自开放网络的放射学描述。这些描述概述了疾病在放射图中的一般视觉特征;当与抽象定义和放射学报告结合时,可提供知识的整体概览。DeViDe 集成了三项关键特征,用于知识增强的视觉-语言对齐:首先,采用大型语言模型进行数据增强,以整合来自不同来源的医学知识。其次,这些知识以不同粒度水平与图像信息对齐。最后,提出一种新型投影层,用于处理在多标签设置下将单个图像与多个描述对齐的复杂性。在零样本设置下,DeViDe 在外部数据集上表现与完全监督模型相当,并在三个大型数据集上实现最先进的结果。此外,对 DeViDe 在四个下游任务和六个分割任务上的微调显示,其在来自不同分布数据上的性能均优异。
引用
@article{arxiv.2404.03618,
title = {DeViDe: Faceted medical knowledge for improved medical vision-language pre-training},
author = {Haozhe Luo and Ziyu Zhou and Corentin Royer and Anjany Sekuboyina and Bjoern Menze},
journal= {arXiv preprint arXiv:2404.03618},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2208.04060 by other authors