中文

用于医学图像与报告多模态表示学习的预训练视觉-语言模型比较

计算机视觉与模式识别 2020-09-04 v1

摘要

从医学图像及关联上下文报告中提取的联合图像-文本嵌入是大多数生物医学视觉-语言(V+L)任务的基础,包括医学视觉问答、临床图像-文本检索、临床报告自动生成。在本研究中,我们采用四种预训练V+L模型:LXMERT、VisualBERT、UNIER和PixelBERT,从MIMIC-CXR放射照片及关联报告中学习多模态表示。在OpenI数据集上的外部评估显示,与开创性的CNN-RNN模型相比,预训练V+L模型学习的联合嵌入在胸部征象分类任务中表现出性能提升。我们进行了消融研究以分析某些模型组件的贡献,并验证了联合嵌入相对于纯文本嵌入的优势。我们还可视化注意力图以说明V+L模型的注意力机制。

关键词

引用

@article{arxiv.2009.01523,
  title  = {A Comparison of Pre-trained Vision-and-Language Models for Multimodal Representation Learning across Medical Images and Reports},
  author = {Yikuan Li and Hanyin Wang and Yuan Luo},
  journal= {arXiv preprint arXiv:2009.01523},
  year   = {2020}
}

备注

10 pages, 3 figures, submitted to BIBM2020