中文

对齐、推理与学习:以知识增强医学视觉-语言预训练

计算与语言 2022-09-16 v1 计算机视觉与模式识别

摘要

医学视觉-语言预训练 (Med-VLP) 因能从医学图像与文本中提取通用视觉-语言表示而受到相当关注。现有方法大多包含三个要素:单模态编码器(即视觉编码器和语言编码器)、多模态融合模块以及 pretext 任务,鲜有研究考虑医学领域专家知识的重要性并显式利用此类知识以促进 Med-VLP。尽管通用领域存在知识增强的视觉-语言预训练 (VLP) 方法,但大多需要现成工具包(如目标检测器和场景图解析器),而这些在医学领域并不可用。本文中,我们提出一种系统且有效的方法,从三个角度利用结构化医学知识增强 Med-VLP。首先,考虑到知识可视为视觉与语言之间的中间媒介,我们通过知识对齐视觉编码器与语言编码器的表示。其次,我们将知识注入多模态融合模型,使模型能以知识作为输入图像与文本的补充进行推理。第三,我们通过设计知识诱导的 pretext 任务引导模型关注图像与文本中最关键的信息。为进行全面评估并推动进一步研究,我们构建了一个包含三项任务的医学视觉-语言基准。实验结果证明了我们方法的有效性,在所有下游任务上均取得了最先进的性能。进一步的分析探究了我们方法不同组件及各种预训练设置的影响。

关键词

引用

@article{arxiv.2209.07118,
  title  = {Align, Reason and Learn: Enhancing Medical Vision-and-Language Pre-training with Knowledge},
  author = {Zhihong Chen and Guanbin Li and Xiang Wan},
  journal= {arXiv preprint arXiv:2209.07118},
  year   = {2022}
}

备注

Natural Language Processing. 10 pages, 3 figures