中文

基于联合自监督学习的医学视觉问答

计算机视觉与模式识别 2023-02-28 v1 人工智能

摘要

视觉问答(VQA)已成为医学影像领域中最活跃的研究问题之一。一个众所周知的 VQA 挑战是图像与文本模态之间的内在差异性,而在医学 VQA 任务中,还存在另一个依赖于有限规模标注图像-问题-答案数据的关键问题。在本研究中,我们提出一种编码器-解码器框架,该框架利用从大规模医学图像-描述数据学习并适配到小规模医学 VQA 任务的图文联合表示。编码器通过自注意力机制跨图像-文本双模态进行嵌入,并在大规模医学图像-描述数据集上通过多个自监督学习任务独立预训练。然后将解码器连接到编码器顶端,并使用小规模医学 VQA 数据集进行微调。实验结果表明,与基线方法和 SOTA 方法相比,我们提出的方法取得了更好的性能。

关键词

引用

@article{arxiv.2302.13069,
  title  = {Medical visual question answering using joint self-supervised learning},
  author = {Yuan Zhou and Jing Mei and Yiqin Yu and Tanveer Syeda-Mahmood},
  journal= {arXiv preprint arXiv:2302.13069},
  year   = {2023}
}