中文

缓解一个、扭曲另一个?文本到图像模型中的交叉偏见应对

计算机视觉与模式识别 2025-05-26 v1

摘要

文本到图像(TTI)模型表现出的偏见通常被视为独立的,尽管在现实中它们可能深度关联。沿一个维度(如种族或年龄)解决偏见可能会无意中影响另一个维度(如性别),从而缓解或加剧现有的差异。理解这些相互依赖关系对于设计更公平的生成模型至关重要,但定量测量此类效应仍是一个挑战。为此,我们引入了 BiasConnect,一个用于分析和量化 TTI 模型中偏见交互的新工具。BiasConnect 沿不同偏见轴进行反事实干预,揭示这些交互的底层结构,并估计缓解一个偏见轴对另一个偏见轴的影响。这些估计与观察到的缓解后结果表现出强相关性(+0.65)。在 BiasConnect 的基础上,我们提出了 InterMit,一种由用户定义的目标分布和优先级权重引导的交叉偏见缓解算法。InterMit 以更少的缓解步骤(平均 2.38 步 vs. 3.15 步)实现了更低的偏见(0.33 vs. 0.52),并优于传统技术产生了更优的图像质量。尽管我们的实现无需训练,InterMit 是模块化的,可以与许多现有的 TTI 模型去偏方法集成,使其成为一个灵活且可扩展的解决方案。

关键词

引用

@article{arxiv.2505.17280,
  title  = {Mitigate One, Skew Another? Tackling Intersectional Biases in Text-to-Image Models},
  author = {Pushkar Shukla and Aditya Chinchure and Emily Diana and Alexander Tolbert and Kartik Hosanagar and Vineeth N Balasubramanian and Leonid Sigal and Matthew Turk},
  journal= {arXiv preprint arXiv:2505.17280},
  year   = {2025}
}