中文

用于医学视觉问答的自监督视觉-语言预训练

计算机视觉与模式识别 2022-11-28 v1 人工智能

摘要

医学图像视觉问答(VQA)是在给定放射图像下回答临床问题的任务,这是一项需要模型整合视觉与语言信息的挑战性问题。为解决训练数据有限的医学VQA问题,预训练-微调范式被广泛用于提升模型泛化能力。本文提出一种自监督方法,在医学图像描述数据集上应用掩码图像建模、掩码语言建模、图像文本匹配及通过对比学习的图像文本对齐(M2I2)进行预训练,并微调至下游医学VQA任务。所提方法在所有三个公开医学VQA数据集上取得最先进性能。我们的代码与模型见于 https://github.com/pengfeiliHEU/M2I2。

关键词

引用

@article{arxiv.2211.13594,
  title  = {Self-supervised vision-language pretraining for Medical visual question answering},
  author = {Pengfei Li and Gang Liu and Lin Tan and Jinying Liao and Shenjun Zhong},
  journal= {arXiv preprint arXiv:2211.13594},
  year   = {2022}
}

备注

5 pages, 3 figures