CMI-MTL:基于交叉Mamba交互的多任务学习用于医学视觉问答
计算机视觉与模式识别
2025-11-04 v1 人工智能
摘要
医学视觉问答(Med-VQA)是临床决策支持和远程医疗中的一项关键多模态任务。近期基于自注意力的方法难以有效处理视觉与语言之间的跨模态语义对齐。此外,基于分类的方法依赖于预定义的答案集。将此任务视为简单的分类问题可能使其无法适应自由形式答案的多样性,并忽略自由形式答案的详细语义信息。为应对这些挑战,我们引入了一个基于交叉Mamba交互的多任务学习(CMI-MTL)框架,该框架从图像和文本中学习跨模态特征表示。CMI-MTL包含三个关键模块:细粒度视觉-文本特征对齐(FVTA)、跨模态交错特征表示(CIFR)和自由形式答案增强的多任务学习(FFAE)。FVTA通过细粒度视觉-文本特征对齐提取图像-文本对中最相关的区域。CIFR通过跨模态交错特征表示捕获跨模态序列交互。FFAE通过自由形式答案增强的多任务学习利用来自开放式问题的辅助知识,提高了模型在开放式Med-VQA上的能力。实验结果表明,CMI-MTL在三个Med-VQA数据集:VQA-RAD、SLAKE和OVQA上优于现有的最先进方法。此外,我们进行了更多的可解释性实验以证明其有效性。代码公开于https://github.com/BioMedIA-repo/CMI-MTL。
引用
@article{arxiv.2511.01357,
title = {CMI-MTL: Cross-Mamba interaction based multi-task learning for medical visual question answering},
author = {Qiangguo Jin and Xianyao Zheng and Hui Cui and Changming Sun and Yuqi Fang and Cong Cong and Ran Su and Leyi Wei and Ping Xuan and Junbo Wang},
journal= {arXiv preprint arXiv:2511.01357},
year = {2025}
}
备注
The paper has been accepted by the 33rd Pacific Conference on Computer Graphics and Applications (Pacific Graphics 2025)