中文

MedCFVQA:一种缓解医学视觉问答中模态偏好偏差的因果方法

计算机视觉与模式识别 2025-05-26 v2

摘要

医学视觉问答(MedVQA)对于通过提供准确且及时地响应来自临床医生就其医学图像所提出的询问,从而提高临床诊断效率至关重要。现有的 MedVQA 模型受到模态偏好偏差的影响,即预测在一个模态(在 MedVQA 中通常是问题)的主导作用,而忽略另一个模态(即图像),从而无法学习多模态知识。为克服模态偏好偏差,我们提出了一种医学反事实 VQA(MedCFVQA)模型,该模型在训练时包含偏差,并利用因果图在推断时消除模态偏好偏差。现有的 MedVQA 数据集在问题和答案之间显示出 substantial prior 依赖关系,这导致即使模型在模态偏好偏差方面严重受到影响,仍能表现出可接受的性能。为解决此问题,我们通过利用现有的 MedVQA 数据集重新构建了新数据集,并更改了训练和测试集中问题及其答案之间的 P3 rior 依赖关系。广泛的实验表明,MedCFVQA 在 SLAKE、RadVQA 和 SLAKE-CP、RadVQA-CP 数据集上均显著优于其非因果对手。

关键词

引用

@article{arxiv.2505.16209,
  title  = {MedCFVQA: A Causal Approach to Mitigate Modality Preference Bias in Medical Visual Question Answering},
  author = {Shuchang Ye and Usman Naseem and Mingyuan Meng and Dagan Feng and Jinman Kim},
  journal= {arXiv preprint arXiv:2505.16209},
  year   = {2025}
}