看见未被看见:EMoE 如何揭示文本到图像扩散模型中的偏见
人工智能
2025-05-20 v1 机器学习
摘要
由于参数数量庞大(常常超过1亿)以及在复杂高维空间中运行(几乎没有限定的输入可能性),文本到图像扩散模型的不确定性估计颇具挑战性。本文提出了一种新型框架——情蒙混合专家(Epistemic Mixture of Experts, EMoE),用于高效估计扩散模型中的情蒙不确定性。EMoE 利用预训练网络,无需额外训练,即可从提示词直接进行不确定性估计。我们利用扩散过程中捕获情蒙不确定性更佳的潜在空间。在COCO数据集上的实验结果表明,EMoE有效且不确定性与图像质量呈现强相关。此外,EMoE识别出样本不足的语言和地区具有更高的不确定性,从而揭示了训练集中的隐藏偏见。这一能力表明,EMoE 作为面向AI生成内容公平性与问责制工具,具有重要意义。
引用
@article{arxiv.2505.13273,
title = {Seeing the Unseen: How EMoE Unveils Bias in Text-to-Image Diffusion Models},
author = {Lucas Berry and Axel Brando and Wei-Di Chang and Juan Camilo Gamboa Higuera and David Meger},
journal= {arXiv preprint arXiv:2505.13273},
year = {2025}
}