中文

基于多模态关系图学习的可解释医学图像视觉问答

计算机视觉与模式识别 2023-02-21 v1

摘要

医学视觉问答(VQA)旨在回答关于输入医学图像的 clinically 相关问题。该技术有潜力提升医疗专业人员效率,同时缓解公共卫生系统负担,尤其在资源匮乏国家。现有医学VQA方法倾向于对医学图像编码并学习视觉特征与问题间的对应,而未利用背后的空间、语义或医学知识。这部分归因于当前医学VQA数据集规模小且常含简单问题。因此,我们首先收集了一个全面且大规模的医学VQA数据集,聚焦于胸部X光图像。我们数据集中的问题涉及详细关系,如疾病名称、位置、程度与类型。基于该数据集,我们还通过构建三种不同关系图——图像区域、问题与语义标签上的空间关系、语义关系与隐式关系图——提出了一种新颖的基线方法。针对不同的问题学习答案与图推理路径。

关键词

引用

@article{arxiv.2302.09636,
  title  = {Interpretable Medical Image Visual Question Answering via Multi-Modal Relationship Graph Learning},
  author = {Xinyue Hu and Lin Gu and Kazuma Kobayashi and Qiyuan An and Qingyu Chen and Zhiyong Lu and Chang Su and Tatsuya Harada and Yingying Zhu},
  journal= {arXiv preprint arXiv:2302.09636},
  year   = {2023}
}