面向社会公平性的视觉语言模型可解释去偏框架
计算机视觉与模式识别
2026-03-02 v1 人工智能
摘要
视觉语言模型(VLMs)的快速发展引发了越来越多的担忧,因为其黑箱推理过程可能导致意外的社会偏见。当前的去偏方法主要通过后处理学习或测试时算法来缓解表层级偏见信号,而未充分探索模型的内部动态。本文引入一种可解释、模型无关的偏见缓解框架DeBiasLens,通过对多模态编码器应用稀疏自编码器(SAEs)来局部化VLMs中的社会属性神经元。基于SAEs的解耦能力,我们在面部图像或标题数据集上训练SAEs(无需对应的社会属性标签),以发现对特定人口统计数据高度敏感的神经元,包括那些被低估的群体。通过选择性地停用与偏见最强关联的社会神经元,我们有效地缓解了VLMs的社会偏见行为,而不会损害其语义知识。我们的研究为未来的审计工具奠定了基础,优先在新兴现实世界AI系统中实现社会公平。
引用
@article{arxiv.2602.24014,
title = {Interpretable Debiasing of Vision-Language Models for Social Fairness},
author = {Na Min An and Yoonna Jang and Yusuke Hirota and Ryo Hachiuma and Isabelle Augenstein and Hyunjung Shim},
journal= {arXiv preprint arXiv:2602.24014},
year = {2026}
}
备注
25 pages, 30 figures, 13 Tables Accepted to CVPR 2026