通过剔除受保护属性表征来消除大型视觉语言模型中的偏见
计算机视觉与模式识别
2024-10-21 v1 计算与语言
机器学习
摘要
大型视觉语言模型(LVLMs)如 LLaVA 已展现出作为通用聊天机器人的卓越能力,能够就提供的输入图像进行交谈。然而,这些模型的响应受训练数据集中存在的社会偏见影响,导致在面对呈现不同人口统计特征图像时,模型作出的回应存在不可取的差异。本文提出了一种 novel 方法,用于 LVLMs 的消偏框架,通过在文本生成期间直接剔除受偏见属性,以避免生成与受保护属性相关的文本,甚至在内部表示这些属性。该方法无需训练,仅需约 1000 个代表性偏见输出样本。我们的实验表明,不仅可以最小化 LVLMs 生成与受保护属性相关文本的倾向,甚至可以使用合成数据指导剔除,同时在如 COCO 等真实数据上的标注性能得以保留。此外,我们发现,经消偏处理后的 LVLMs 生成内容在准确率上与基线有偏见模型相似,表明在不牺牲模型性能的前提下,仍可实现消偏效果。
引用
@article{arxiv.2410.13976,
title = {Debiasing Large Vision-Language Models by Ablating Protected Attribute Representations},
author = {Neale Ratzlaff and Matthew Lyle Olson and Musashi Hinck and Shao-Yen Tseng and Vasudev Lal and Phillip Howard},
journal= {arXiv preprint arXiv:2410.13976},
year = {2024}
}
备注
NeurIPS workshop on SafeGenAI, 10 pages, 2 figures