中文

他们都是医生:合成多样化反事实样本以缓解关联偏差

计算机视觉与模式识别 2024-06-18 v1 信息检索 机器学习

摘要

视觉语言模型(VLM),如CLIP,是强大的模型;然而,它们可能表现出不期望的偏差,当直接部署在文本到图像、文本到视频检索、反向搜索或分类任务等应用中时,会降低其安全性。在这项工作中,我们提出了一个新颖的框架,用于生成合成的反事实图像,以创建一个多样化且平衡的数据集,可用于微调CLIP。给定来自文本到图像模型的一组多样化合成基础图像,我们利用现成的分割和修复模型,将具有多样化视觉外观的人置于上下文中。我们表明,在此类数据集上训练的CLIP能够学习将人的外观与图像上下文解耦,即,决定一个人是否是医生的因素并非与其视觉外观(如肤色或体型)相关,而是与上下文(如背景、所穿着的服装或所持物品)相关。我们证明,我们微调后的CLIP模型CFαCF_\alpha在图像检索任务中将MaxSkew、MinSkew和NDKL等关键公平性指标提升了40-66%,同时在下游任务中仍能达到相似水平的性能。我们表明,通过设计,我们的模型保留了与原始CLIP模型的最大兼容性,并且可以轻松控制以即插即用的方式支持不同的准确率与公平性权衡。

关键词

引用

@article{arxiv.2406.11331,
  title  = {They're All Doctors: Synthesizing Diverse Counterfactuals to Mitigate Associative Bias},
  author = {Salma Abdel Magid and Jui-Hsien Wang and Kushal Kafle and Hanspeter Pfister},
  journal= {arXiv preprint arXiv:2406.11331},
  year   = {2024}
}