中文

学习裁剪:面向医学 VQA 的端到端因果图剪枝与动态解剖特征库

计算机视觉与模式识别 2026-03-30 v1

摘要

医学视觉问答(MedVQA)模型由于依赖数据集特定的相关性(如反复出现的解剖模式或问题类型规律)而非真正的诊断证据,通常表现出有限的泛化能力。现有的因果方法通常作为静态调整或事后修正来实现。为了解决这个问题,我们提出了一个可学习因果裁剪(LCT)框架,将因果剪枝集成到端到端优化中。我们引入了一个动态解剖特征库(DAFB),通过动量机制更新,用于捕获频繁解剖和语言模式的全局原型,作为数据集级规律的近似。我们进一步设计了一个可微分裁剪模块,估计实例级表示与全局特征库之间的依赖关系。与全局原型高度相关的特征被软抑制,而实例特定证据被强调。这种可学习机制鼓励模型自适应地优先考虑因果信号而非虚假相关。在 VQA-RAD、SLAKE、SLAKE-CP 和 PathVQA 上的实验表明,LCT 一致地优于现有的去偏策略,提高了鲁棒性和泛化能力。

关键词

引用

@article{arxiv.2603.26028,
  title  = {Learning to Trim: End-to-End Causal Graph Pruning with Dynamic Anatomical Feature Banks for Medical VQA},
  author = {Zibo Xu and Qiang Li and Weizhi Nie and Yuting Su},
  journal= {arXiv preprint arXiv:2603.26028},
  year   = {2026}
}