双重因果推断:整合后门调整与工具变量学习用于医学视觉问答
计算机视觉与模式识别
2026-04-23 v1 人工智能
摘要
医学视觉问答旨在根据复杂的医学图像和问题生成临床可靠的答案。然而,现有方法常常过拟合于表面的跨模态相关性,忽视了多模态医学数据中嵌入的内在偏差。因此,模型容易受到跨模态混杂效应的影响,严重阻碍了其提供可信诊断推理的能力。为了解决这一局限性,我们为医学视觉问答提出了一种新颖的双重因果推断框架。据我们所知,双重因果推断是首个整合后门调整和工具变量学习以联合处理可观测和不可观测混杂因素的统一架构。具体来说,我们构建了一个结构因果模型,其中可观测的跨模态偏差(例如,频繁的视觉和文本共现)通过后门调整来缓解,而不可观测的混杂因素则使用从共享潜在空间学习的工具变量来补偿。为了保证工具变量的有效性,我们设计了互信息约束,以最大化其对融合多模态表示的依赖性,同时最小化其与不可观测混杂因素和目标答案的关联。通过这种双重机制,双重因果推断提取出能够捕捉真实因果关系的去混杂表示。在四个基准数据集SLAKE、SLAKE-CP、VQA-RAD和PathVQA上的大量实验表明,我们的方法始终优于现有方法,特别是在分布外泛化方面。此外,定性分析证实,双重因果推断通过显式地将真实因果效应与虚假的跨模态捷径解耦,显著增强了跨模态推理的可解释性和鲁棒性。
引用
@article{arxiv.2604.20306,
title = {Dual Causal Inference: Integrating Backdoor Adjustment and Instrumental Variable Learning for Medical VQA},
author = {Zibo Xu and Qiang Li and Ke Lu and Jin Wang and Weizhi Nie and Yuting Su},
journal= {arXiv preprint arXiv:2604.20306},
year = {2026}
}