EquiSteer:通过交叉注意力引导实现更公平的文本引导图像生成
计算机视觉与模式识别
2026-07-01 v1
摘要
文本到图像扩散模型驱动着日常创意任务,但它们仍然会重现训练数据中的人口统计偏见。对于诸如“a photo of a nurse”、“a photo of a CEO”之类的常见提示,它们会因训练数据的统计特征而非文本中的任何内容,将输出偏向某一性别。现有的去偏方法在狭窄环境下显示出潜力,但需要重新训练、批量级控制或特定于提示的调整,限制了其可扩展性。我们提出了 EquiSteer,一种无需训练的方法,通过在推理时引导交叉注意力(CA)激活来逐样本工作。对于每个目标属性,EquiSteer 从对比提示中预计算引导向量。然后在生成时,一个提示感知门控使特定属性的提示保持不变,而对于中性提示,它从 CA 激活中清除现有的属性信号并注入目标属性。在 SD-1.5、SD-2.1、SDXL 和 SANA 上,EquiSteer 将平均差异差距减少了高达 87%,而对图像质量和文本-图像对齐的影响极小。代码可在 https://github.com/Atmyre/EquiSteer 获取。
引用
@article{arxiv.2607.01147,
title = {EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation},
author = {Tatiana Gaintseva and Akshit Achara and Gregory Slabaugh and Jiankang Deng and Ismail Elezi},
journal= {arXiv preprint arXiv:2607.01147},
year = {2026}
}