文本到图像模型的多组比例表示
计算机视觉与模式识别
2025-06-02 v1 人工智能
摘要
文本到图像(T2I)生成模型能够根据文本描述创建生动、逼真的图像。随着这些模型的激增,它们暴露出关于其表示不同人口群体、传播刻板印象和抹除少数群体能力的新问题。尽管对人工智能(AI)的“安全”和“负责任”设计日益关注,但目前尚无成熟的方法来系统地测量和控制图像生成中的表示性伤害。本文引入了一个新框架,通过应用多组比例表示指标来测量 T2I 模型生成的图像中交叉群体的表示。MPR 评估生成模型产生的图像中给定群体间表示统计的最坏情况偏差,允许根据用户需求进行灵活且特定于上下文的测量。我们还开发了一种算法来针对该指标优化 T2I 模型。通过实验,我们证明 MPR 能够有效测量多个交叉群体的表示统计,并且当用作训练目标时,能够引导模型在保持生成质量的同时,在各人口群体间实现更平衡的生成。
引用
@article{arxiv.2505.24023,
title = {Multi-Group Proportional Representation for Text-to-Image Models},
author = {Sangwon Jung and Alex Oesterling and Claudio Mayrink Verdun and Sajani Vithana and Taesup Moon and Flavio P. Calmon},
journal= {arXiv preprint arXiv:2505.24023},
year = {2025}
}