中文

FairCLIP:在视觉-语言学习中利用公平性

计算机视觉与模式识别 2024-04-09 v2

摘要

公平性是深度学习中的一个关键问题,尤其是在医疗保健领域,这些模型影响诊断和治疗决策。尽管公平性已在纯视觉领域得到研究,但由于缺乏用于研究公平性的医学视觉-语言(VL)数据集,医学VL模型的公平性仍未得到探索。为了弥补这一研究空白,我们引入了第一个公平视觉-语言医学数据集Harvard-FairVLMed,该数据集提供了详细的人口统计属性、真实标签和临床笔记,以促进对VL基础模型公平性的深入检查。利用Harvard-FairVLMed,我们对两种广泛使用的VL模型(CLIP和BLIP2)进行了全面的公平性分析,这些模型在自然和医学领域进行了预训练,涉及四个不同的受保护属性。我们的结果突出了所有VL模型中的显著偏差,其中亚洲人、男性、非西班牙裔和西班牙语分别是种族、性别、民族和语言受保护属性中的偏好子群。为了减轻这些偏差,我们提出了FairCLIP,一种基于最优传输的方法,通过减少整体样本分布与每个群体对应分布之间的Sinkhorn距离,实现了性能和公平性之间的有利权衡。作为首个此类VL数据集,Harvard-FairVLMed有潜力推动既具有伦理意识又具有临床效果的机器学习模型的发展。我们的数据集和代码可在https://ophai.hms.harvard.edu/datasets/harvard-fairvlmed10k获取。

关键词

引用

@article{arxiv.2403.19949,
  title  = {FairCLIP: Harnessing Fairness in Vision-Language Learning},
  author = {Yan Luo and Min Shi and Muhammad Osama Khan and Muhammad Muneeb Afzal and Hao Huang and Shuaihang Yuan and Yu Tian and Luo Song and Ava Kouhana and Tobias Elze and Yi Fang and Mengyu Wang},
  journal= {arXiv preprint arXiv:2403.19949},
  year   = {2024}
}

备注

CVPR 2024