中文

基于单模态与多模态对比损失的掩码视觉语言预训练用于医学视觉问答

计算机视觉与模式识别 2023-07-12 v1 人工智能

摘要

医学视觉问答(VQA)是一项具有挑战性的任务,需要通过考虑视觉与语言信息来回答给定医学图像的临床表现问题。然而,由于医学 VQA 训练数据规模较小,预训练-微调范式已成为提升模型泛化性能的常用方案。本文提出一种新颖的自监督方法,利用医学图像描述数据集,通过结合单模态与多模态对比损失以及掩码语言建模和图像文本匹配作为预训练目标,学习输入图像与文本的单模态及多模态特征表示。随后将预训练模型迁移至下游医学 VQA 任务。所提方法在三个公开可用的医学 VQA 数据集上取得了最先进(SOTA)性能,准确率分别显著提升 2.2%、14.7% 和 1.7%。此外,我们进行了全面分析以验证方法中不同组件的有效性,并研究了不同的预训练设置。我们的代码与模型可在 https://github.com/pengfeiliHEU/MUMC 获取。

关键词

引用

@article{arxiv.2307.05314,
  title  = {Masked Vision and Language Pre-training with Unimodal and Multimodal Contrastive Losses for Medical Visual Question Answering},
  author = {Pengfei Li and Gang Liu and Jinlong He and Zixu Zhao and Shenjun Zhong},
  journal= {arXiv preprint arXiv:2307.05314},
  year   = {2023}
}

备注

accepted by MICCAI2023