KG-CMI:知识图谱增强的跨Mamba交互用于医学视觉问答
计算机视觉与模式识别
2026-04-02 v1
摘要
医学视觉问答(Med-VQA)是临床决策支持和远程医疗中的一项关键多模态任务。近期方法未能充分利用领域特定的医学知识,使得难以准确地将医学图像中的病变特征与关键诊断标准关联起来。此外,基于分类的方法通常依赖于预定义的答案集。将Med-VQA视为简单的分类问题限制了其适应自由形式答案多样性的能力,并可能忽略这些答案中的详细语义信息。为应对这些挑战,我们提出了知识图谱增强的跨Mamba交互(KG-CMI)框架,该框架由细粒度跨模态特征对齐(FCFA)模块、知识图谱嵌入(KGE)模块、跨模态交互表示(CMIR)模块和自由形式答案增强多任务学习(FAMT)模块组成。KG-CMI通过有效地将专业医学知识通过图进行整合,学习图像和文本的跨模态特征表示,建立病变特征与疾病知识之间的关联。此外,FAMT利用开放式问题的辅助知识,提高了模型在开放式Med-VQA中的能力。实验结果表明,KG-CMI在三个Med-VQA数据集上超越了现有的最先进方法,即VQA-RAD、SLAKE和OVQA。此外,我们进行了可解释性实验以进一步验证该框架的有效性。
引用
@article{arxiv.2604.00601,
title = {KG-CMI: Knowledge graph enhanced cross-Mamba interaction for medical visual question answering},
author = {Xianyao Zheng and Hong Yu and Hui Cui and Changming Sun and Xiangyu Li and Ran Su and Leyi Wei and Jia Zhou and Junbo Wang and Qiangguo Jin},
journal= {arXiv preprint arXiv:2604.00601},
year = {2026}
}