精准归因:通过局部化归因生成减少基础模型中的社会偏见
计算机视觉与模式识别
2024-12-13 v1
摘要
在 web 抓取数据集上训练的基础模型会将社会偏见传递到下游任务中。虽然归因生成可用于偏差分析,但现有方法通过修改服装和背景等情境元素来引入人工痕迹。我们提出一种局部化归因生成方法,通过自动遮蔽和引导式填充来限制归因修改仅限于特定属性相关区域,从而保持图像情境。当应用于Conceptual Captions数据集创建性别归因时,我们的方法在视觉和语义保真度方面优于最先进的替代方案,同时保持使用仅真实数据训练的模型在非人类中心任务上的性能。使用我们的归因进行微调的模型在多个指标上显示出可测量的偏差减少,包括性别分类差异的降低和人物偏好得分的平衡,同时保持ImageNet零样本性能。这些结果建立了一个既能实现准确偏差轮廓绘制又能有效缓解偏差的平衡数据集框架。
引用
@article{arxiv.2412.09160,
title = {Pinpoint Counterfactuals: Reducing social bias in foundation models via localized counterfactual generation},
author = {Kirill Sirotkin and Marcos Escudero-Viñolo and Pablo Carballeira and Mayug Maniparambil and Catarina Barata and Noel E. O'Connor},
journal= {arXiv preprint arXiv:2412.09160},
year = {2024}
}