DeAR:利用加性残差对视觉-语言模型去偏
计算机视觉与模式识别
2023-03-21 v1
摘要
大型预训练视觉-语言模型(VLM)通过提供丰富、可适配的图像与文本表示,减少了为各类视觉接地语言下游任务开发预测模型的时间。然而,这些模型因训练数据中各身份群体的偏斜分布而存在社会偏见。这些偏见表现为特定文本概念与不同身份群体人物图像表示之间相似度的偏斜,从而限制了此类模型在现实高风险应用中的可用性。本文中,我们提出 DeAR(Debiasing with Additive Residuals,利用加性残差去偏),一种新颖的去偏方法,其学习加性残差图像表示以抵消原始表示,确保公平的输出表示。在此过程中,它降低了表示区分不同身份群体的能力。此外,我们观察到当前的公平性测试在有限的面部图像数据集上进行,无法说明特定文本概念为何应当/不应当适用于它们。为弥补这一差距并更好地评估 DeAR,我们引入了受保护属性标签关联(Protected Attribute Tag Association, PATA)数据集——一个用于评估大型预训练 VLM 公平性的新基于上下文的偏见基准数据集。此外,PATA 为不同场景中具有积极与消极内涵的多样化人群提供了视觉上下文。使用多个数据集进行的公平性与零样本性能保持实验结果表明了我们框架的有效性。
引用
@article{arxiv.2303.10431,
title = {DeAR: Debiasing Vision-Language Models with Additive Residuals},
author = {Ashish Seth and Mayur Hemani and Chirag Agarwal},
journal= {arXiv preprint arXiv:2303.10431},
year = {2023}
}
备注
Accepted to CVPR'23. Codes and dataset will be released soon