中文

面向视觉语言模型偏见的基准测试与缓解——debiaSAE

计算与语言 2025-04-01 v2 计算机视觉与模式识别

摘要

随着视觉语言模型(VLM)的广泛应用,其公平性仍未得到充分探索。本文分析了五个模型和六个数据集之间的人口统计偏见。我们发现,像 UTKFace 和 CelebA 这样的肖像数据集是检测偏见的最佳工具,发现了 LLaVa 和 CLIP 模型在性能和公平性方面的差距。而且,基于场景的数据集如 PATA 和 VLStereoSet 未能作为偏见基准测试,因为其文本提示允许模型在没有图片的情况下猜测答案。至于基于代词的数据集如 VisoGender,我们获得了混合信号,因为只有部分子数据集在提供见解方面有用。为缓解这两个问题,我们引入了一个更严格的评估数据集和一个基于稀疏自编码器的去偏方法,以帮助减少模型中的偏见。我们发现,我们的数据集比以前的数据集生成更有意义的错误。此外,我们的去偏方法在公平性方面取得改进,净增 5-15 分的性能。本研究显示了当前衡量视觉语言模型中人口统计偏见的基准测试存在的问题,并引入了一个更有效的数据集用于衡量偏见以及一个新颖且可解释的基于稀疏自编码器的去偏方法。

关键词

引用

@article{arxiv.2410.13146,
  title  = {debiaSAE: Benchmarking and Mitigating Vision-Language Model Bias},
  author = {Kuleen Sasse and Shan Chen and Jackson Pond and Danielle Bitterman and John Osborne},
  journal= {arXiv preprint arXiv:2410.13146},
  year   = {2025}
}

备注

Under Review at COLM 2025