中文

多语言文本到图像生成放大性别刻板印象且提示工程或难奏效

计算与语言 2025-06-03 v4 计算机与社会 机器学习

摘要

文本到图像生成模型近期在图像质量、灵活性和文本对齐方面取得了惊人的成果,因此被应用于快速增长的应用场景中。通过多语言能力的提升,更广泛的社群现已能够使用这项技术。然而,我们的结果表明,多语言模型与单语模型一样,存在显著的性别偏见。此外,多语言模型在不同语言间会提供相似结果这一自然预期并不成立,相反,不同语言之间存在重要差异。我们提出了一个新的基准测试 MAGBIG,旨在促进多语言模型中性别偏见的研究。我们使用 MAGBIG 来研究多语言特性对文本到图像模型中性别偏见的影响。为此,我们构建了多语言提示,要求生成具有特定职业或特征的人物肖像。结果表明,模型不仅表现出强烈的性别偏见,而且在不同语言中的行为也不同。此外,我们研究了提示工程策略,例如间接、中性的表述,以减轻这些偏见。遗憾的是,这些方法收效有限,并导致文本到图像的对齐效果变差。因此,我们呼吁对图像生成器中跨语言的多样化表征以及可操控性进行更多研究,以解决有偏见的模型行为。

关键词

引用

@article{arxiv.2401.16092,
  title  = {Multilingual Text-to-Image Generation Magnifies Gender Stereotypes and Prompt Engineering May Not Help You},
  author = {Felix Friedrich and Katharina Hämmerl and Patrick Schramowski and Manuel Brack and Jindrich Libovicky and Kristian Kersting and Alexander Fraser},
  journal= {arXiv preprint arXiv:2401.16092},
  year   = {2025}
}