中文

通过自动提示搜索揭示文本到图像模型中的隐藏偏见

机器学习 2026-03-18 v2

摘要

文本到图像(TTI)扩散模型已取得了显著的视觉质量,但它们反复被证明在性别、种族和年龄等敏感属性上表现出社会偏见。为缓解这些偏见,现有方法通常依赖于精心策划的提示数据集——要么人工构建,要么由大语言模型(LLM)生成——作为其训练和/或评估程序的一部分。除策划成本外,这还可能遗漏那些触发偏见生成的、未被预期的、不那么明显的提示,即使模型已经过去偏见处理。在本工作中,我们引入了偏见引导提示搜索(Bias-Guided Prompt Search, BGPS),一个自动生成旨在最大化生成图像中偏见存在的提示的框架。BGPS 包含两个组件:(1)一个被指示生成属性中性提示的 LLM,以及(2)作用于 TTI 内部表示的属性分类器,引导 LLM 的解码过程向放大感兴趣图像属性的提示空间区域移动。我们在 Stable Diffusion 1.5 和一个最先进的去偏见模型上进行了广泛实验,发现了一系列微妙且此前未被记录的偏见,这些偏见严重恶化了公平性指标。关键的是,所发现的提示是可解释的,即它们可以被典型用户输入,与一个著名硬提示优化对应方法相比,在困惑度指标上实现了定量改善。我们的发现揭示了 TTI 漏洞,同时 BGPS 扩展了偏见搜索空间,可以作为偏见缓解的新评估工具。

关键词

引用

@article{arxiv.2512.08724,
  title  = {Exposing Hidden Biases in Text-to-Image Models via Automated Prompt Search},
  author = {Manos Plitsis and Giorgos Bouritsas and Vassilis Katsouros and Yannis Panagakis},
  journal= {arXiv preprint arXiv:2512.08724},
  year   = {2026}
}

备注

Accepted (poster) at the ICLR 2026 Workshop for Algorithmic Fairness Across Alignment Procedures and Agentic Systems