中文

基于负面提示词的强化一步文本到图像扩散模型

计算机视觉与模式识别 2025-09-26 v3

摘要

实时图像合成的日益增长的需求推动了一步扩散模型的显著进展,这些模型本质上比传统的多步骤方法具有加速的生成速度。然而,这种提高的效率常常伴随对图像属性可控性的妥协。虽然负面提示词通常通过分类器自由指导(CFG)实现,对多步骤模型中的细粒度控制效果良好,但其应用于一步生成器的研究仍有限。由于缺乏像多步骤扩散那样的迭代细化,直接将CFG应用于一步生成会导致混合性瑕疵并降低输出质量。为填补这一空白,我们引入了负向-远离-引导-注意力(NASA),一种集成负面提示词到一步扩散模型的高效方法。NASA在中间表示空间内通过利用跨注意力机制抑制不希望的视觉属性。该策略避免了输出空间指导中固有的混合性瑕疵,实现了高效,仅增加1.89%的FLOPs,相较于CFG的计算翻倍。此外,NASA可以无缝集成到现有的 timestep 蒸馏框架中,提高学生的输出质量。实验结果表明,NASA大幅提高了可控性和输出质量,达到HPSv2评分的31.21,为一步扩散模型树立了新的最先进基准。

关键词

引用

@article{arxiv.2412.02687,
  title  = {Supercharged One-step Text-to-Image Diffusion Models with Negative Prompts},
  author = {Viet Nguyen and Anh Nguyen and Trung Dao and Khoi Nguyen and Cuong Pham and Toan Tran and Anh Tran},
  journal= {arXiv preprint arXiv:2412.02687},
  year   = {2025}
}

备注

Accepted at ICCV 2025