中文

MedKLIP:放射学中医学知识增强的语言-图像预训练

图像与视频处理 2023-04-04 v3 计算与语言 计算机视觉与模式识别

摘要

在本文中,我们考虑利用放射科日常实践中的图像-文本报告对,以领域特定知识增强医学视觉-语言预训练(VLP)。具体而言,我们做出了以下贡献:首先,与现有工作直接处理原始报告不同,我们采用一种新颖的三元组抽取模块来提取医学相关信息,避免了语言语法带来的不必要复杂性并增强了监督信号;其次,我们提出了一种新颖的三元组编码模块,通过查询知识库进行实体翻译,以利用医学领域丰富的领域知识,并在语言嵌入空间中隐式建立医学实体间的关系;第三,我们提出使用基于 Transformer 的融合模型,在图像块级别将实体描述与视觉信号进行空间对齐,从而实现医学诊断能力;第四,我们进行了充分的实验来验证我们架构的有效性,并在众多公开基准上进行了评测,例如 ChestX-ray14、RSNA Pneumonia、SIIM-ACR Pneumothorax、COVIDx CXR-2、COVID Rural 和 EdemaSeverity。在零样本和微调设置下,我们的模型在疾病分类和定位任务上相比以往方法均展现出强劲性能。

关键词

引用

@article{arxiv.2301.02228,
  title  = {MedKLIP: Medical Knowledge Enhanced Language-Image Pre-Training in Radiology},
  author = {Chaoyi Wu and Xiaoman Zhang and Ya Zhang and Yanfeng Wang and Weidi Xie},
  journal= {arXiv preprint arXiv:2301.02228},
  year   = {2023}
}