中文

跨模态和跨任务的视觉语言模型统一去偏方法

计算机视觉与模式识别 2024-10-30 v2 人工智能

摘要

近期视觉语言模型(VLMs)的进展使其能够通过同时处理文本和图像数据来执行复杂的多模态任务,显著提升了人工智能领域的发展。然而,这些模型常常表现出偏见,可导致输出倾向于社会刻板印象,从而需要去偏策略。现有的去偏方法仅聚焦于特定模态或任务,且需要大量重新训练。为克服这些限制,本文提出了一种新方法——基于选择性特征插值去偏(Selective Feature Imputation for Debiasing, SFID),该方法将特征剪枝和低置信度插值(LCI)相结合,以有效减少 VLMs 中的偏见。SFID 方法具有普适性,能够保持输出的语义完整性,同时无需重新训练即可实现高效去偏。我们的实验结果表明,SFID 在包括零样本分类、文本到图像检索、图像描述生成和文本到图像生成等多种 VLMs 任务中均表现出色,通过显著降低性别偏见而不损害性能。该方法不仅提升了 VLMs 应用的公平性,也保留了其在各种场景下的效率和实用性。

关键词

引用

@article{arxiv.2410.07593,
  title  = {A Unified Debiasing Approach for Vision-Language Models across Modalities and Tasks},
  author = {Hoin Jung and Taeuk Jang and Xiaoqian Wang},
  journal= {arXiv preprint arXiv:2410.07593},
  year   = {2024}
}

备注

NeurIPS 2024 (Spotlight), the Thirty-Eighth Annual Conference on Neural Information Processing Systems