MuVAM:一种基于多视角注意力的医学视觉问答模型
计算机视觉与模式识别
2021-07-08 v1
摘要
医学视觉问答(VQA)是计算机视觉与自然语言处理研究界广泛考虑的多模态挑战性任务。由于当前大多数医学 VQA 模型关注视觉内容、忽略文本的重要性,本文提出一种基于多视角注意力的模型(MuVAM)用于医学视觉问答,其在文本描述基础上融合了医学图像的高层语义。首先,利用不同方法提取图像与问题的特征以对应视觉与文本两种模态。其次,本文提出一种包含图像到问题(I2Q)注意力与词到文本(W2T)注意力的多视角注意力机制。多视角注意力可将问题与图像及词相关联,以更好地分析问题并得到准确答案。第三,提出一种复合损失,用于在多模态特征融合后准确预测答案,并提升视觉与文本跨模态特征间的相似性。其由分类损失与图像-问题互补(IQC)损失组成。最后,针对 VQA-RAD 数据集中的数据错误与标签缺失,我们与医学专家协作修正并补全该数据集,进而构建了增强数据集 VQA-RADPh。在这两个数据集上的实验表明,MuVAM 的有效性超越了当前最优方法。
引用
@article{arxiv.2107.03216,
title = {MuVAM: A Multi-View Attention-based Model for Medical Visual Question Answering},
author = {Haiwei Pan and Shuning He and Kejia Zhang and Bo Qu and Chunling Chen and Kun Shi},
journal= {arXiv preprint arXiv:2107.03216},
year = {2021}
}