中文

Q2ATransformer:通过答案查询解码器改进医学视觉问答

计算机视觉与模式识别 2023-06-06 v2 人工智能

摘要

医学视觉问答(VQA)系统在理解医学图像所携带的临床相关信息方面起着辅助作用。对医学图像的问题包括两类:闭合式(如是否问题)和开放式。为获得答案,现有大多数医学 VQA 方法依赖于分类方法,而少数工作尝试使用生成方法或二者混合。分类方法相对简单,但在长开放式问题上表现较差。为弥补这一差距,本文提出一种基于 Transformer 的新医学 VQA 框架(命名为 Q2ATransformer),它集成了分类与生成方法的优势,并对闭合式和开放式问题提供统一处理。具体而言,我们引入一个额外的 Transformer 解码器,带有一组可学习的候选答案嵌入,以查询给定图像-问题对中每个答案类的存在性。通过 Transformer 注意力,候选答案嵌入与图像-问题对的融合特征交互以做出决策。如此,尽管是基于分类的方法,我们的方法像基于生成的方法一样提供了与答案信息交互以进行预测的机制。另一方面,通过分类,我们通过缩减答案搜索空间来降低任务难度。我们的方法在两个医学 VQA 基准上取得了新的最先进性能。特别地,对于开放式问题,我们在 VQA-RAD 上达到 79.19%,在 PathVQA 上达到 54.85%,分别有 16.09% 和 41.45% 的绝对提升。

关键词

引用

@article{arxiv.2304.01611,
  title  = {Q2ATransformer: Improving Medical VQA via an Answer Querying Decoder},
  author = {Yunyi Liu and Zhanyu Wang and Dong Xu and Luping Zhou},
  journal= {arXiv preprint arXiv:2304.01611},
  year   = {2023}
}