面向医学 VQA 的意图感知视觉线索 (InViC)
计算机视觉与模式识别
2026-03-18 v1
摘要
医学视觉问答 (Med-VQA) 旨在基于医学图像回答临床相关问题。然而,现有多模态大语言模型 (MLLM) 常表现出快捷式回答,即通过利用语言先验或数据集偏差生成看似合理的响应,而不足以关注视觉证据。这种行为削弱了临床可靠性,尤其在影像发现微小时更为明显。我们提出一种轻量级插件框架,称为意图感知视觉线索 (Intent-aware Visual Cues, InViC),以显式增强医学 VQA 中的图像基答案生成。InViC 引入一种线索标记提取 (Cue Tokens Extraction, CTE) 模块,将稠密视觉标记压缩为 K 个以问题为条件的线索标记集合,这些标记作为结构化的视觉中介被注入 LLM 解码器,以促进意图对齐的视觉证据。为防止绕过视觉信息,我们进一步设计了两阶段微调策略,采用线索瓶颈注意力掩码。在阶段 I 中,使用注意力掩码阻断 LLM 对原始视觉特征的直接查看,从而将所有视觉证据引导通过线索路径。在阶段 II 中,恢复标准的因果注意力,以训练 LLM 同时利用视觉标记和线索标记。我们在三个公开的 Med-VQA 基准测试 (VQA-RAD、SLAKE 和 ImageCLEF VQA-Med 2019) 上评估了 InViC,跨越多个代表性的 MLLM。InViC 在零样例推理和标准 LoRA 微调方面均一致提升,表明意图感知的视觉线索配合瓶颈训练是提升可信赖 Med-VQA 的一种实用且有效的策略。
引用
@article{arxiv.2603.16372,
title = {InViC: Intent-aware Visual Cues for Medical Visual Question Answering},
author = {Zhisong Wang and Ziyang Chen and Zanting Ye and Hongze Zhu and Yefeng Zheng and Yong Xia},
journal= {arXiv preprint arXiv:2603.16372},
year = {2026}
}
备注
10 pages, 2 figures