中文

RAMM:基于多模态预训练与检索增强的生物医学视觉问答方法

计算机视觉与模式识别 2023-03-02 v1 计算与语言

摘要

视觉-语言多模态预训练与微调在视觉问答(VQA)中已展现出巨大成功。与通用领域VQA相比,生物医学VQA的性能受限于数据匮乏。本文中,我们提出一种名为RAMM的检索增强预训练-微调范式用于生物医学VQA,以克服数据限制问题。具体而言,我们收集了一个名为PMCPM的新生物医学数据集,其提供基于患者的图像-文本对,包含来自PubMed的多样患者情境。然后,我们预训练生物医学多模态模型以学习图像-文本对的视觉与文本表示,并通过图像-文本对比目标(ITC)对齐这些表示。最后,我们提出一种检索增强方法以更好地利用有限数据。我们提出基于预训练中的ITC检索相似图像-文本对,并引入一种新颖的检索-注意力模块,将图像与问题的表示同检索到的图像与文本相融合。实验表明,我们的检索增强预训练-微调范式在Med-VQA2019、Med-VQA2021、VQARAD和SLAKE数据集上取得了最先进的性能。进一步分析显示,相较于先前的资源与方法,所提出的RAMM与PMCPM能够提升生物医学VQA性能。我们将开源我们的数据集、代码与预训练模型。

关键词

引用

@article{arxiv.2303.00534,
  title  = {RAMM: Retrieval-augmented Biomedical Visual Question Answering with Multi-modal Pre-training},
  author = {Zheng Yuan and Qiao Jin and Chuanqi Tan and Zhengyun Zhao and Hongyi Yuan and Fei Huang and Songfang Huang},
  journal= {arXiv preprint arXiv:2303.00534},
  year   = {2023}
}