中文

FairEnc:一种用于青光眼检测的具有公平视觉与文本编码器的公平视觉-语言模型

计算机视觉与模式识别 2026-05-07 v1 人工智能 机器学习 图像与视频处理 定量方法

摘要

自动化青光眼检测对于防止不可逆的视力丧失和减轻医疗保健系统的负担至关重要。然而,确保在不同患者群体中的公平性仍然是一个重大挑战。在本文中,我们提出了 FairEnc,一种用于视觉-语言模型(VLM)的公平预训练方法,能够跨多个敏感属性同时去偏。FairEnc 联合减轻了文本和视觉两种模态中关于多个敏感属性(包括种族、性别、民族和语言)的偏差。具体而言,对于文本编码器,我们利用大型语言模型生成具有不同敏感属性但保留疾病语义的合成临床描述,并采用对比对齐目标来鼓励人口统计学不变表示。对于视觉编码器,我们提出了一种双层公平策略,结合了互信息正则化(以减少学习特征与人口统计学群体之间的统计依赖性)和多判别器对抗去偏。在公开可用的 Harvard-FairVLMed 数据集上的综合实验表明,FairEnc 有效地减少了由 DPD 和 DEOdds 衡量的人口统计学差异,同时在零样本和线性探测评估下均实现了强大的诊断性能。在私有 FairFundus 数据集上的额外实验表明,FairEnc 在跨域和跨模态设置下始终如一地保持公平性优势,并在有竞争力的范围内维持诊断性能。这些结果突出了 FairEnc 在分布偏移下泛化公平性的能力,支持了其在现实世界临床环境中更公平部署的潜力。我们的代码库和合成临床笔记可在 https://github.com/Mohamed-Elhabebe/FairEnc 获取。

关键词

引用

@article{arxiv.2605.04882,
  title  = {FairEnc: A Fair Vision-Language Model with Fair Vision and Text Encoders for Glaucoma Detection},
  author = {Mohamed Elhabebe and Ayman El-Baz and Qing Liu},
  journal= {arXiv preprint arXiv:2605.04882},
  year   = {2026}
}