中文

基于稀疏自编码器的文本到图像生成模型无模型性性别偏差控制

机器学习 2025-11-24 v2 计算机视觉与模式识别

摘要

文本到图像(T2I)扩散模型常常表现出性别偏差,尤其是在职业与性别化主体之间生成刻板印象关联。本文提出了 SAE Debias,一个轻量且无模型性的框架,用于缓解 T2I 生成中的性别偏差。不同于先前依赖 CLIP-based 过滤或提示工程的方法,这些方法通常需要模型特定的调整且控制有限,SAE Debias 直接在特征空间内工作,无需重新训练或修改网络结构。通过利用在性别偏差数据集上预训练的 k-稀疏自编码器,该方法识别稀疏潜在空间中与性别相关的方向,捕获职业刻板印象。具体而言,为每个职业构建一个偏置方向并在推理时抑制该方向,以引导生成更平衡的性别输出。仅训练一次,稀疏自编码器提供可重用的偏置方向,实现有效的控制并提供对偏置子空间的可解释性洞察。在包括 Stable Diffusion 1.4、1.5、2.1 和 SDXL 在内的多个 T2I 模型上进行的大规模评估表明,SAE Debias 在保持生成质量的同时显著减少了性别偏差。鉴于本文是首次将稀疏自编码器应用于识别和干预 T2I 模型中的性别偏差,我们的发现促进了构建社会负责的生成式 AI,提供一种可解释且无模型性的工具以支持文本到图像生成中的公平性。

关键词

引用

@article{arxiv.2507.20973,
  title  = {Model-Agnostic Gender Bias Control for Text-to-Image Generation via Sparse Autoencoder},
  author = {Chao Wu and Zhenyi Wang and Kangxian Xie and Naresh Kumar Devulapally and Vishnu Suresh Lokhande and Mingchen Gao},
  journal= {arXiv preprint arXiv:2507.20973},
  year   = {2025}
}