基于跨注意力融合的医学视觉问答的层次建模
计算机视觉与模式识别
2025-04-11 v2 人工智能
摘要
医学视觉问答(Med-VQA)利用医学图像回答临床问题,辅助诊断。设计MedVQA系统对辅助临床诊断和提高诊断准确率具有重大意义。基于这一基础,层次化医学VQA通过组织医学问题的层次结构并对各层次进行特定预测来扩展医学VQA,以处理细粒度区分。近期许多研究提出了层次化MedVQA任务并建立了数据集,但仍存在若干问题:(1)层次建模不完善,导致问题层次区分不佳,引发层次间语义碎片化。(2)过度依赖基于Transformer的跨模态自注意力融合方法中的隐式学习,使关键局部语义关联在医学场景中难以被捕获。为此,本研究提出了HiCA-VQA方法,包括两个模块:针对医学问题的层次化提示和层次化答案解码器。层次化提示模块在文本提示与图像特征之间进行预对齐,以根据问题类型引导模型聚焦于特定图像区域;层次化解码器对不同层次的问题进行独立预测,以提高各粒度层面的准确率。该框架还包含一个跨注意力融合模块,其中图像充当查询,文本充当键值对。在Rad-Restruct基准数据集上的实验表明,HiCA-VQA框架在回答层次化细粒度问题方面优于现有领先方法。本研究为层次化视觉问答系统提供了有效路径,推动了医学图像理解。
引用
@article{arxiv.2504.03135,
title = {Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion},
author = {Junkai Zhang and Bin Li and Shoujun Zhou and Yue Du},
journal= {arXiv preprint arXiv:2504.03135},
year = {2025}
}