中文

LaPA:面向医学视觉问答的潜在提示辅助模型

计算机视觉与模式识别 2024-04-22 v1 计算与语言

摘要

医学视觉问答(Med-VQA)旨在自动预测医学图像和问题的正确答案,从而协助医生减少重复性任务并减轻其工作量。现有方法主要侧重于使用额外且全面的数据集对模型进行预训练,随后进行微调以增强下游任务的性能。然而,探索利用现有模型提取临床相关信息也具有重要价值。本文提出了用于医学视觉问答的潜在提示辅助模型(LaPA)。首先,我们设计了潜在提示生成模块,在目标答案的约束下生成潜在提示。随后,我们提出了带有潜在提示融合模块的多模态融合块,利用潜在提示从单模态和多模态特征中提取临床相关信息。此外,我们引入了先验知识融合模块,将疾病与器官之间的关系与临床相关信息进行整合。最后,我们将最终整合的信息与图像-语言跨模态信息相结合,以预测最终答案。在三个公开可用的 Med-VQA 数据集上的实验结果表明,LaPA 优于最先进的 ARL 模型,在 VQA-RAD、SLAKE 和 VQA-2019 上分别取得了 1.83%、0.63% 和 1.80% 的提升。代码公开于 https://github.com/GaryGuTC/LaPA_model。

关键词

引用

@article{arxiv.2404.13039,
  title  = {LaPA: Latent Prompt Assist Model For Medical Visual Question Answering},
  author = {Tiancheng Gu and Kaicheng Yang and Dongnan Liu and Weidong Cai},
  journal= {arXiv preprint arXiv:2404.13039},
  year   = {2024}
}

备注

10 pages, 4 figures, Accepted by CVPRW2024