中文

UNCAGE:基于对比注意力引导的掩码生成变换器文本到图像生成

计算机视觉与模式识别 2025-08-08 v1 人工智能 机器学习

摘要

文本到图像 (T2I) 生成正在使用扩散模型和自回归模型进行积极研究。最近,掩码生成变换器因其双向注意力和并行解码能力,克服了自回归模型因果注意力和自回归解码的固有限制,成为一种具有竞争力的替代方案,实现高质量图像生成。然而,组合 T2I 生成仍具有挑战性,即使是最先进的扩散模型也常常难以准确绑定属性并实现良好的文本-图像对齐。虽然扩散模型在此方面受到广泛研究,但掩码生成变换器也存在类似限制但尚未得到探索。在本文中,我们提出了 Unmasking with Contrastive Attention Guidance (UNCAGE),一种新颖的无训练方法,通过注意力图优先处理清晰代表单个对象的 token,以提高组合保真度。UNCAGE 在多个基准和指标上实现了显著的定性和定量性能提升,推理开销可忽略不计。我们的代码已公开,链接为 https://github.com/furiosa-ai/uncage。

关键词

引用

@article{arxiv.2508.05399,
  title  = {UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation},
  author = {Wonjun Kang and Byeongkeun Ahn and Minjae Lee and Kevin Galim and Seunghyuk Oh and Hyung Il Koo and Nam Ik Cho},
  journal= {arXiv preprint arXiv:2508.05399},
  year   = {2025}
}

备注

Code is available at https://github.com/furiosa-ai/uncage