MMBERT: 面向改进医学 VQA 的多模态 BERT 预训练
计算机视觉与模式识别
2021-04-06 v1 计算与语言
机器学习
摘要
医学领域的图像与通用领域图像有本质不同。因此,直接将通用领域视觉问答(VQA)模型用于医学领域是不可行的。此外,医学图像标注是一个昂贵且耗时的过程。为克服这些局限,我们受 Transformer 风格架构在 NLP、视觉与语言任务上自监督预训练的启发提出一种方案。我们的方法涉及在大型医学图像+描述数据集上,以图像特征作为 pretext task,通过掩码语言建模(MLM)学习更丰富的医学图像与文本语义表示。所提方案在两个放射学图像 VQA 数据集——VQA-Med 2019 与 VQA-RAD 上取得了新的最优(state-of-the-art)性能,甚至优于先前最佳方案的集成模型。此外,我们的方案提供注意力图,有助于模型可解释性。代码见 https://github.com/VirajBagal/MMBERT。
引用
@article{arxiv.2104.01394,
title = {MMBERT: Multimodal BERT Pretraining for Improved Medical VQA},
author = {Yash Khare and Viraj Bagal and Minesh Mathew and Adithi Devi and U Deva Priyakumar and CV Jawahar},
journal= {arXiv preprint arXiv:2104.01394},
year = {2021}
}