文本到图像生成中的偏见综述:定义、评估与缓解
计算机视觉与模式识别
2024-05-03 v3 人工智能
计算机与社会
摘要
近期具有文本到图像(T2I)生成能力的强大大型模型——如 OpenAI 的 DALLE-3 和 Google 的 Gemini——的发展,使得用户能够根据文本提示生成高质量图像。然而,越来越明显的是,即使是简单的提示也可能导致 T2I 模型在生成的图像中表现出明显的社会偏见。这种偏见可能导致社会中的分配性伤害和代表性伤害,进一步边缘化少数群体。注意到这一问题,近期有大量工作致力于研究 T2I 系统中不同维度的偏见。然而,目前缺乏对这些研究的广泛综述,阻碍了对当前进展和研究空白的系统性理解。我们提出了关于 T2I 生成模型中偏见的首次广泛综述。在本次综述中,我们回顾了先前关于偏见维度的研究:性别、肤色和地理文化。具体而言,我们讨论了这些工作如何定义、评估和缓解不同方面的偏见。我们发现:(1)虽然性别和肤色偏见被广泛研究,但地理文化偏见仍然探索不足;(2)大多数关于性别和肤色偏见的工作调查了职业关联,而其他方面的研究较少;(3)几乎所有性别偏见的研究都忽略了非二元性别身份;(4)评估数据集和指标分散,没有测量偏见的统一框架;(5)当前的缓解方法无法全面解决偏见。基于当前的局限性,我们指出了未来有助于以人为本的偏见定义、评估和缓解的研究方向。我们希望强调研究 T2I 系统中偏见的重要性,并鼓励未来的工作全面理解和解决偏见,为每个人构建公平且值得信赖的 T2I 技术。
引用
@article{arxiv.2404.01030,
title = {Survey of Bias In Text-to-Image Generation: Definition, Evaluation, and Mitigation},
author = {Yixin Wan and Arjun Subramonian and Anaelia Ovalle and Zongyu Lin and Ashima Suvarna and Christina Chance and Hritik Bansal and Rebecca Pattichis and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2404.01030},
year = {2024}
}