中文

基于原因-效应驱动的医学视觉问答鲁棒性优化框架

计算机视觉与模式识别 2025-06-24 v1 人工智能

摘要

现有的医学视觉问答 (Med-VQA) 模型常因语言偏置而受限, 即问题类型与答案类别之间存在虚假关联. 为此, 本文提出一种因果-效应驱动优化框架, 称为 CEDO, 该框架综合运用三种既定机制: 模态驱动的异构优化 (MHO)、梯度引导的模态协同 (GMS) 和分布适应的损失重缩放 (DLR), 从因果和效应两个层面全面缓解语言偏置. 具体而言, MHO 为特定模态设置自适应学习率, 实现异构优化, 从而增强鲁棒推理能力. 此外, GMS 采用帕累托优化方法, 促进模态间的协同互动, 并强制梯度正交, 以消除偏置更新, 从效应层面缓解语言偏置, 即shortcut bias. 此外, DLR 旨�为各个损失分配自适应权重, 确保所有答案类别的平衡学习, 从因果层面缓解数据集中不平衡偏置. 在多个传统和偏置敏感基准测试上进行的广泛实验持续表明, CEDO 在鲁棒性方面优于最先进的竞争方法.

关键词

引用

@article{arxiv.2506.17903,
  title  = {Cause-Effect Driven Optimization for Robust Medical Visual Question Answering with Language Biases},
  author = {Huanjia Zhu and Yishu Liu and Xiaozhao Fang and Guangming Lu and Bingzhi Chen},
  journal= {arXiv preprint arXiv:2506.17903},
  year   = {2025}
}

备注

Accepted at IJCAI 2025