中文

评估大型视觉语言模型在多样人口统计属性和提示下的公平性

计算与语言 2025-09-23 v3 计算机视觉与模式识别

摘要

大型视觉语言模型(LVLMs)最近取得了显著进展,展现出在开放世界视觉理解方面的强大能力。然而,尚不清楚的是,LVLMs在现实生活中如何处理人口统计偏见,尤其是跨属性(如性别、肤色、年龄和种族)的差异。在本文中,我们通过使用公开的公平性基准数据集(如 FACET、UTKFace),实证调查了几主流 LVLMs 在人口统计属性上的表现差异。我们的公平性评估框架在视觉问答/分类任务中采用直接和单选问答提示。尽管在视觉理解方面取得了进展,但我们的零样本提示结果表明,无论是开源还是闭源 LVLMs,都在不同提示和人口统计群体之间继续存在公平性问题。此外,我们提出了一种可能的基于多模态链式思维(CoT)的不公平性缓解策略,适用于开源和闭源模型。该方法增强了透明度,为解决公平性问题提供了可扩展的解决方案,为未来的研究和实际做法奠定了坚实的基础。本研究使用的数据集和代码均可在本 GitHub 仓库公开获取。

关键词

引用

@article{arxiv.2406.17974,
  title  = {Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts},
  author = {Xuyang Wu and Yuan Wang and Hsin-Tai Wu and Zhiqiang Tao and Yi Fang},
  journal= {arXiv preprint arXiv:2406.17974},
  year   = {2025}
}

备注

EMNLP Findings