中文

视觉语言模型中的文化意识:一项跨国探索

计算机与社会 2025-05-28 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

视觉语言模型 (VLM) 越来越多地被部署在多样化的文化语境中,但其内部偏见仍然知之甚少。在这项工作中,我们提出了一个新颖的框架,以系统地评估 VLM 如何编码跨国家的种族、性别和身体特征相关的文化差异与偏见。我们引入了三个基于检索的任务:(1) 种族到国家检索,考察特定种族群体(东亚人、白人、中东人、拉丁裔、南亚人和黑人)的个体与不同国家之间的关联;(2) 个人特征到国家检索,将图像与基于特征的提示(例如聪明、诚实、罪犯、暴力)配对,以调查潜在的刻板印象关联;以及 (3) 身体特征到国家检索,关注诸如瘦、年轻、肥胖和年老等视觉属性,以探索外貌在文化上如何与国家相联系。我们的发现揭示了 VLM 中持续存在的偏见,突显了视觉表征可能如何无意中强化社会刻板印象。

关键词

引用

@article{arxiv.2505.20326,
  title  = {Cultural Awareness in Vision-Language Models: A Cross-Country Exploration},
  author = {Avinash Madasu and Vasudev Lal and Phillip Howard},
  journal= {arXiv preprint arXiv:2505.20326},
  year   = {2025}
}