中文

文本到图像模型及其对不同民族人员从事活动的表现

计算机视觉与模式识别 2026-04-14 v5 计算机与社会

摘要

本文探讨了流行文本到图像 (T2I) 模型,DALL-E 3 和 Gemini 3 Pro Preview 在生成描述不同民族人员从事常见日常活动时的表现方式。开发了五个情景,生成了 2,060 张图像,使用指定民族的输入提示生成这些图像。当聚合各活动和模型的结果时,发现 28.4% 的图像描绘了穿着传统服饰的个人,包括在几种情况下不适合指定活动的服饰。这一模式与地区显著相关,其中中东与北非和亚洲洲部比例过高,也与世界银行收入群体相关。类似的地区和收入关联模式也出现在两个与运动相关的活动中。为评估图像-文本对齐情况,使用 CLIP、ALIGN 和 GPT-4.1 mini 对 9,270 组图像-提示对进行评分。获得传统服饰标签的图像在包含国家名称的提示中获得了显著更高的对齐得分,而在移除国家名称后,这一模式减弱或反转。修订后的提示分析显示,一个模型经常插入"传统"一词(传统标记图像为 50.3% vs. 16.6%)。这些结果表明,这些表征模式可以由管道的多个组件影响,包括图像生成器、评估模型和提示修订。

关键词

引用

@article{arxiv.2504.06313,
  title  = {Text-to-Image Models and Their Representation of People from Different Nationalities Engaging in Activities},
  author = {Abdulkareem Alsudais},
  journal= {arXiv preprint arXiv:2504.06313},
  year   = {2026}
}