中文

迈向鲁棒的医疗公平性:通过文本引导的属性解耦提示学习实现视觉-语言模型去偏双模态对齐

计算机视觉与模式识别 2025-08-27 v1

摘要

确保医疗诊断在不同人口群体间的公平性对于公平医疗至关重要,尤其是在由成像设备和临床实践差异导致的分布偏移下。视觉-语言模型(VLM)展现出强大的泛化能力,且文本提示编码了身份属性,能够显式识别并移除敏感方向。然而,现有的去偏方法通常独立处理视觉和文本模态,留下了残余的跨模态错位和公平性差距。为应对这一挑战,我们提出了 DualFairVL,一个联合进行去偏和跨模态表示对齐的多模态提示学习框架。DualFairVL 采用并行的双分支架构来分离敏感属性和目标属性,从而实现跨模态的解耦且对齐的表示。通过线性投影构建近似正交的文本锚点,引导交叉注意力机制生成融合特征。超网络进一步解耦与属性相关的信息,并生成实例感知的视觉提示,这些提示编码了用于公平性和鲁棒性的双模态线索。在视觉分支中应用了基于原型的正则化,以强制敏感特征的分离并加强与文本锚点的对齐。在跨四种模态的八个医学影像数据集上的广泛实验表明,DualFairVL 在分布内和分布外设置下均实现了最先进的公平性和准确性,仅用 360 万可训练参数便优于全微调和参数高效基线。代码将在发表后发布。

关键词

引用

@article{arxiv.2508.18886,
  title  = {Toward Robust Medical Fairness: Debiased Dual-Modal Alignment via Text-Guided Attribute-Disentangled Prompt Learning for Vision-Language Models},
  author = {Yuexuan Xia and Benteng Ma and Jiang He and Zhiyong Wang and Qi Dou and Yong Xia},
  journal= {arXiv preprint arXiv:2508.18886},
  year   = {2025}
}