解构偏见:诊断文本到图像生成模型中文化与构成不平等的多层面框架
计算机视觉与模式识别
2025-05-06 v1
摘要
文本到图像(T2I)模型的变革潜力取决于其根据文本提示合成文化多样、逼真图像的能力。然而,这些模型常常固化其训练数据中嵌入的文化偏见,导致系统性的错误表征。本文对成分包含分数(CIS)进行了基准测试,该指标旨在评估跨文化背景下图像生成的保真度。通过对 2400 张图像的广泛分析,我们从构成脆弱性和语境错位两方面量化了偏见,揭示了西方与非西方文化提示之间存在显著的性能差距。我们的发现强调了数据不平衡、注意力熵和嵌入叠加对模型公平性的影响。通过使用 CIS 对 Stable Diffusion 等模型进行基准测试,我们为增强人工智能生成图像的文化包容性提供了架构和数据中心干预方面的见解。这项工作通过提供一个诊断和缓解 T2I 生成中偏见的综合工具,推动了该领域的发展,倡导更公平的人工智能系统。
引用
@article{arxiv.2505.01430,
title = {Deconstructing Bias: A Multifaceted Framework for Diagnosing Cultural and Compositional Inequities in Text-to-Image Generative Models},
author = {Muna Numan Said and Aarib Zaidi and Rabia Usman and Sonia Okon and Praneeth Medepalli and Kevin Zhu and Vasu Sharma and Sean O'Brien},
journal= {arXiv preprint arXiv:2505.01430},
year = {2025}
}
备注
Published at ICLR 2025 Workshop SynthData