超越内容:语法性别如何塑造文本到图像模型中的视觉表征
计算与语言
2026-02-03 v4
摘要
文本到图像(Text-to-Image,T2I)模型偏见研究主要聚焦于人口统计代表性和刻板特征,忽略了一个根本问题:语法性别如何影响跨语言中的视觉表征?我们引入一个跨语言基准,检验语法性别与刻板性别关联矛盾的词语(例如“une sentinelle”——法语中语法上为中性词,但指代刻板意义上的“守卫”)。该数据集覆盖五种性别化语言(法语、西班牙语、德语、意大利语、俄语)和两种无性别控制语言(英语、中文),包含800个唯一提示,生成28,800张图像。我们的分析表明,语法性别显著影响图像生成:中性语法标记使男性表征提升至平均73%(相较于无性别英语的22%),而女性语法标记使女性表征提升至38%(相较于英语的28%)。这些效应随语言资源 availability 和模型架构而系统性变化,高资源语言显示更强效应。我们的发现表明,语言结构本身而非内容,塑造了AI生成的视觉输出,为理解多语言多模态系统中的偏见和公平性提供了新维度。
引用
@article{arxiv.2508.03199,
title = {Beyond Content: How Grammatical Gender Shapes Visual Representation in Text-to-Image Models},
author = {Muhammed Saeed and Shaina Raza and Ashmal Vayani and Muhammad Abdul-Mageed and Ali Emami and Shady Shehata},
journal= {arXiv preprint arXiv:2508.03199},
year = {2026}
}