中文

嵌入算术:后处理文本到图像模型偏见缓解的轻量、无调参框架

计算机视觉与模式识别 2026-04-21 v1

摘要

现代文本到图像(T2I)模型放大了有害社会偏见,挑战了其伦理部署。我们引入一种推理时间方法,可可靠地缓解社会偏见,同时保持提示语义和视觉上下文(背景、布局和风格)不变。这确保了上下文一致性,并提供了可调的缓解强度参数,使实践者能够在公平性与连贯性之间进行细粒度控制。通过嵌入算术,我们分析了偏见在嵌入空间中的结构,并在不改变模型权重、提示或数据集的情况下对其进行纠正。在 FLUX 1.0-Dev 和 Stable Diffusion 3.5-Large 上的实验表明,条件嵌入空间形成的是一个复杂、纠缠的流形,而非解耦概念的网格。为严格评估语义保存(超越 CLIP 分数的循环性和偏见局限性),我们提出了概念连贯性分数(CCS)。在该稳健指标评估下,我们轻量、无调参的方法在提高多样性的同时显著优于现有基线,有效解决了公平性-连贯性的关键权衡。通过刻画模型如何表示社会概念,我们在潜在空间几何理解方面建立了原则性路径,通向更透明、可控且公平的图像生成。

关键词

引用

@article{arxiv.2604.18167,
  title  = {Embedding Arithmetic: A Lightweight, Tuning-Free Framework for Post-hoc Bias Mitigation in Text-to-Image Models},
  author = {Venkatesh Thirugnana Sambandham and Torsten Schön},
  journal= {arXiv preprint arXiv:2604.18167},
  year   = {2026}
}

备注

A demo notebook with basic implementations can be found at \url{https://github.com/cvims/EMBEDDING-ARITHMETIC}