基于视觉注意力的纵向医学视觉问答
人工智能
2025-12-09 v2 计算机视觉与模式识别
摘要
纵向医学视觉问答(Diff-VQA)需要比较不同时间点上的配对研究,并回答关于临床意义变化的问题。在这种情况下,差分信号和视觉关注在时间上的一致性比单个图像的绝对发现更具信息量。我们提出一种基于视觉注意力的编码器-解码器,用于胸部 X 光 Diff-VQA,将事后注意力转化为可操作的监督信号。该模型首先执行轻量级的近恒等仿射预对齐,以减少访问之间的扰动。随后,它在每个 epoch 内执行两步循环:步骤 1 从答案中提取与疾病相关的关键词,并在两幅图像上生成关键词条件化的 Grad-CAM 以获得疾病聚焦的注意力;步骤 2 将共享注意力掩码应用于两个时间点,并生成最终答案。这闭合了语言-视觉循环,使得重要术语也指导模型注意力,从而在对应解剖结构上强制实现空间一致的注意。 在 Medical-Diff-VQA 上,该方法在 BLEU、ROUGE-L、CIDEr 和 METEOR 指标上均取得具竞争力的性能,同时提供内在可解释性。值得注意的是, backbone 和解码器是通用领域预训练的,未进行放射科专门预训练,这凸显了实用性和可迁移性。这些结果支持带轻度预对齐的基于注意力条件化生成作为纵向推理在医学 VQA 中的原则框架。
引用
@article{arxiv.2509.25374,
title = {Saliency Guided Longitudinal Medical Visual Question Answering},
author = {Jialin Wu and Xiaofeng Liu},
journal= {arXiv preprint arXiv:2509.25374},
year = {2025}
}
备注
Published in NeurIPS Workshop