中文

MISS:面向医学视觉问答的生成式预训练与微调方法

计算机视觉与模式识别 2024-06-21 v3 人工智能

摘要

医学视觉问答(VQA)是一项具有挑战性的多模态任务,其中视觉-语言预训练(VLP)模型可以有效提升泛化性能。然而,医学领域的大多数方法将VQA视为答案分类任务,难以迁移到实际应用场景。此外,由于医学图像的隐私性和昂贵的标注过程,用于预训练的大规模医学图像-文本对数据集严重匮乏。本文提出了一种基于大规模多任务自监督学习的框架(MISS),用于医学VQA任务。与现有方法不同,我们将医学VQA视为生成式任务。我们统一了文本编码器和多模态编码器,并通过多任务学习对齐图像-文本特征。此外,我们提出了一种“迁移-描述”(Transfer-and-Caption)方法,利用大语言模型(LLMs)扩展单模态图像数据集的特征空间,使那些传统的医学视觉领域任务数据能够应用于VLP。实验表明,我们的方法在使用较少多模态数据集的情况下取得了优异的结果,并展示了生成式VQA模型的优势。

关键词

引用

@article{arxiv.2401.05163,
  title  = {MISS: A Generative Pretraining and Finetuning Approach for Med-VQA},
  author = {Jiawei Chen and Dingkang Yang and Yue Jiang and Yuxuan Lei and Lihua Zhang},
  journal= {arXiv preprint arXiv:2401.05163},
  year   = {2024}
}

备注

ICANN, 2024