中文

按需设计:利用视觉问答进行多模态预训练

计算机视觉与模式识别 2024-10-02 v3 计算与语言

摘要

多模态预训练在医学领域展示了其潜力,它从配对的医学报告中学习医学视觉表示。然而,许多预训练任务需要临床医生的额外标注,而且大多数任务未能明确指导模型学习不同病理的期望特征。在本文中,我们利用视觉问答(VQA)进行多模态预训练,以引导框架关注目标病理特征。我们利用医学报告中的描述来设计与不同疾病相关的多粒度问答对,这有助于框架在预训练时无需专家的额外标注。我们还提出了一个新颖的预训练框架,包含一个准文本特征变换器,这是一个通过对比学习策略将视觉特征变换到更接近文本域的准文本空间的模块。这缩小了视觉-语言差距并促进了模态对齐。我们的框架应用于四个下游任务:报告生成、分类、分割和检测,涵盖五个数据集。大量实验证明了我们的框架相对于其他最先进方法的优越性。我们的代码可在https://github.com/MoramiSu/QFT-MICCAI2024获取。

关键词

引用

@article{arxiv.2404.00226,
  title  = {Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training},
  author = {Tongkun Su and Jun Li and Xi Zhang and Haibo Jin and Hao Chen and Qiong Wang and Faqin Lv and Baoliang Zhao and Yin Hu},
  journal= {arXiv preprint arXiv:2404.00226},
  year   = {2024}
}

备注

Accepted by MICCAI2024