中文

通过非对比视觉属性引导在测试时消除大型多模态模型的偏差

计算机视觉与模式识别 2025-09-19 v3 机器学习

摘要

大型多模态模型(LMMs)已展现出作为通用聊天机器人的强大能力,能够就视觉输入进行对话。然而,它们的响应受到训练数据集中存在的社会偏见的影响,导致模型在看到描绘不同人口群体的图像时产生不理想的响应差异。在这项工作中,我们提出了一种针对 LMMs 的免训练去偏框架,该框架通过构建一个减少对受保护属性引用的引导向量,在文本生成期间对模型的表示进行干预。我们的框架引入了两种互补的方法:(1)一种基于数据集的方法,通过对比模型在偏见输入和中性输入上的激活来构建引导向量;(2)一种专为低资源环境设计的新型基于优化的方法,该方法使用单步基于梯度的扰动来构建引导向量,无需额外数据。我们的实验表明,这些干预措施有效降低了 LMMs 生成与受保护属性相关文本的倾向,同时保持了情感和流畅性。此外,我们证明了去偏后的 LMMs 在下游任务上实现了与未修改模型相当的准确率,表明可以在不牺牲模型性能的情况下实现偏差缓解。

关键词

引用

@article{arxiv.2411.12590,
  title  = {Debias your Large Multi-Modal Model at Test-Time via Non-Contrastive Visual Attribute Steering},
  author = {Neale Ratzlaff and Matthew Lyle Olson and Musashi Hinck and Estelle Aflalo and Shao-Yen Tseng and Vasudev Lal and Phillip Howard},
  journal= {arXiv preprint arXiv:2411.12590},
  year   = {2025}
}

备注

10 pages, 6 Figures, 8 Tables. arXiv admin note: text overlap with arXiv:2410.13976