中文

通过关键词解释发现并缓解视觉偏差

机器学习 2024-03-28 v4 计算机视觉与模式识别

摘要

解决计算机视觉模型中的偏差对于现实世界中的 AI 部署至关重要。然而,由于视觉偏差的不可解释性,缓解视觉偏差具有挑战性,通常只能通过可视化或样本统计间接识别,这需要额外的人工监督来进行解释。为解决此问题,我们提出了 Bias-to-Text (B2T) 框架,将视觉偏差解释为关键词。具体而言,我们从误预测图像的描述文本中提取常见关键词,以识别模型中潜在的偏差。然后,我们使用视觉-语言评分模型测量这些关键词与误预测图像的相似度来验证它们。视觉偏差的关键词解释形式具有若干优势,例如为偏差发现提供清晰的组命名,以及利用这些组名自然扩展到去偏差。我们的实验表明,B2T 能够识别已知偏差,如 CelebA 中的性别偏差、Waterbirds 中的背景偏差,以及 ImageNet-R/C 中的分布偏移。此外,B2T 在更大规模的数据集(如 Dollar Street 和 ImageNet)中发现了新颖偏差。例如,我们在 ImageNet 中发现了“bee”与“flower”之间的上下文偏差。我们还展示了 B2T 关键词的多种应用,包括去偏差训练、CLIP 提示和模型比较。

关键词

引用

@article{arxiv.2301.11104,
  title  = {Discovering and Mitigating Visual Biases through Keyword Explanation},
  author = {Younghyun Kim and Sangwoo Mo and Minkyu Kim and Kyungmin Lee and Jaeho Lee and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2301.11104},
  year   = {2024}
}

备注

CVPR 2024. First two authors contributed equally