中文

面向医学视觉问答的分层深度多模态网络

计算与语言 2020-09-29 v1 计算机视觉与模式识别 机器学习

摘要

医学领域视觉问答 (VQA-Med) 在为终端用户提供医疗辅助方面起着重要作用。这些用户预期会提出答案为是/否的直接问题,或需要详细描述的具有挑战性的问题。VQA-Med 中的现有技术未能区分不同问题类型,有时使较简单问题复杂化,或使复杂问题过度简化。诚然,对于不同问题类型采用多个独立系统会给终端用户带来困惑与不适。为解决此问题,我们提出了一种分层深度多模态网络,该网络分析并分类终端用户问题/查询,然后采用特定于查询的方法进行答案预测。我们将所提方法简称为基于分层问题分离视觉问答 (HQS-VQA)。我们的贡献有三方面:首先,我们提出了一种针对 VQA-Med 的问题分离 (QS) 技术;其次,我们将 QS 模型集成到分层深度多模态神经网络中以生成与医学图像相关查询的恰当答案;第三,我们通过比较所提带 QS 模型与不带 QS 模型的性能,研究了 QS 在医学-VQA 中的影响。我们在两个基准数据集 RAD 和 CLEF18 上评估了所提模型的性能。实验结果表明,我们的 HQS-VQA 技术以显著优势优于基线模型。我们还对所得结果进行了详细的定量与定性分析,并发现了错误的潜在原因及其解决方案。

关键词

引用

@article{arxiv.2009.12770,
  title  = {Hierarchical Deep Multi-modal Network for Medical Visual Question Answering},
  author = {Deepak Gupta and Swati Suman and Asif Ekbal},
  journal= {arXiv preprint arXiv:2009.12770},
  year   = {2020}
}

备注

Accepted for publication at Expert Systems with Applications