医学视觉问答中的局部化问题
计算机视觉与模式识别
2023-07-04 v1
摘要
视觉问答(VQA)模型旨在回答关于给定图像的自然语言问题。由于其能够提出不同于模型训练时所使用的问题,医学 VQA 近年来受到了广泛关注。然而,现有的医学 VQA 模型通常侧重于回答涉及整幅图像的问题,而非相关内容在图像中的位置。因此,VQA 模型在可解释性能力以及针对特定图像区域探查模型的可能性方面受到限制。本文提出一种用于医学 VQA 的新方法,通过开发一个能够回答关于图像区域的问题同时考虑回答该问题所需上下文的模型,来解决这一局限。我们的实验结果表明了所提模型的有效性,在三个数据集上优于现有方法。我们的代码和数据可在 https://github.com/sergiotasconmorales/locvqa 获取。
引用
@article{arxiv.2307.01067,
title = {Localized Questions in Medical Visual Question Answering},
author = {Sergio Tascon-Morales and Pablo Márquez-Neila and Raphael Sznitman},
journal= {arXiv preprint arXiv:2307.01067},
year = {2023}
}
备注
Appears in Medical Image Computing and Computer Assisted Interventions (MICCAI), 2023