面向 CLIP 的联合视觉-语言社会偏见消除
计算机视觉与模式识别
2024-11-21 v1
摘要
诸如CLIP等视觉-语言预训练模型在各种下游任务中展现出卓越的能力。尽管具有此潜力,V-L模型却因其固有的社会偏见而受到众所周知的限制。一个典型的表现是,V-L模型经常对特定人群产生有偏见的预测,这严重削弱了它们在现实世界中的适用性。现有方法试图通过从模型嵌入中移除有偏见的属性信息来缓解V-L模型中的社会偏见问题。然而,在我们重新审视这些方法后发现,它们的去偏见往往伴随着V-L对齐能力的大幅受损。我们随后揭示,这种性能下降源于图像和文本嵌入中不平衡的去偏见。为了解决这个问题,我们提出了一种新颖的V-L去偏见框架,先对齐图像和文本偏见,然后从两种模态中将其移除。通过这样做,我们的方法在去偏见嵌入中保持V-L对齐的同时,实现了多模态偏见缓解。此外,我们提倡一种新的评估协议,它可以1)整体量化模型去偏见和V-L对齐能力,以及2)评估社会偏见消除模型的泛化能力。我们相信这项工作将为未来解决CLIP中社会偏见问题的研究提供新的见解和指导。
引用
@article{arxiv.2411.12785,
title = {Joint Vision-Language Social Bias Removal for CLIP},
author = {Haoyu Zhang and Yangyang Guo and Mohan Kankanhalli},
journal= {arXiv preprint arXiv:2411.12785},
year = {2024}
}