中文

MF2-MVQA:一种用于医学视觉问答的多阶段特征融合方法

计算机视觉与模式识别 2022-11-14 v1 人工智能

摘要

医学视觉问答任务中的一个关键问题是如何在有限数据集下有效实现语言与医学图像的特征融合。为更好利用医学图像的多尺度信息,以往方法直接将多阶段视觉特征图分别嵌入为同等大小的 token 并与文本表示融合。但这会导致不同阶段的视觉特征混淆。为此,我们提出一种简洁而强大的多阶段特征融合方法 MF2-MVQA,其分阶段将多层次视觉特征与文本语义融合。MF2-MVQA 在 VQA-Med 2019 与 VQA-RAD 数据集上取得 State-Of-The-Art 性能。可视化结果也验证了我们的模型优于以往工作。

关键词

引用

@article{arxiv.2211.05991,
  title  = {MF2-MVQA: A Multi-stage Feature Fusion method for Medical Visual Question Answering},
  author = {Shanshan Song and Jiangyun Li and Jing Wang and Yuanxiu Cai and Wenkai Dong},
  journal= {arXiv preprint arXiv:2211.05991},
  year   = {2022}
}