中文

LightFair:面向公平文本到图像扩散模型的高效替代方案 via Debiasing Pre-trained Text Encoders

计算机视觉与模式识别 2025-09-30 v1 人工智能 机器学习

摘要

本文探讨了一种新颖的轻量级方法 LightFair,通过消除文本编码器的偏差来实现公平的文本到图像扩散模型(T2I DMs)。大多数现有方法要么通过全参数训练来耦合扩散模型的不同部分,要么依赖辅助网络进行校正。它们导致训练或采样负担沉重且效果不佳。由于 T2I DMs 由多个组件构成,其中文本编码器是最易微调和前端模块,本文聚焦于通过微调文本嵌入来缓解偏差。为验证可行性,我们观察到文本编码器的中性嵌入输出在 CLIP 空间中显示出显著的偏斜,尤其体现在不同属性图像嵌入之间。更重要的是,噪声预测网络进一步放大了这种不平衡。为微调文本嵌入,我们提出了一种协作距离约束去偏策略,通过平衡嵌入距离来提升公平性,而无需额外参考。然而,缓解偏差可能会损害原始生成质量。为此,我们引入一种两阶段文本引导的采样策略,以限制去偏后文本编码器的介入时机。大量实验表明,LightFair 方法有效且高效。值得注意的是,在 Stable Diffusion v1.5 上,我们的方法仅需训练负担的 1/4,即可实现 SOTA 去偏,且几乎没有增加采样负担。代码已公开于 https://github.com/boyuh/LightFair。

关键词

引用

@article{arxiv.2509.23639,
  title  = {LightFair: Towards an Efficient Alternative for Fair T2I Diffusion via Debiasing Pre-trained Text Encoders},
  author = {Boyu Han and Qianqian Xu and Shilong Bao and Zhiyong Yang and Kangli Zi and Qingming Huang},
  journal= {arXiv preprint arXiv:2509.23639},
  year   = {2025}
}