中文

VSF:通过价值符号翻转实现少步图像生成模型的简单、高效且有效的负面指导

计算机视觉与模式识别 2026-02-20 v6 图形学

摘要

我们提出 Value Sign Flip (VSF),一种用于少步扩散和 flow-matching 图像生成模型的简单、高效且有效的负面提示指导方法。与现有方法如 classifier-free guidance (CFG)、NASA 和 NAG 不同,VSF 通过翻转来自负面提示的注意力值的符号来动态抑制不希望出现的内容。该方法仅需轻微的计算开销,并能有效集成到 MMDiT 风格的架构中,如 Stable Diffusion 3.5 Turbo,也可与基于 cross-attention 的模型如 Wan 集成。我们在具有复杂提示对的挑战性数据集上对 VSF 进行验证,证明其在 static image 和 video 生成任务中性能卓越。实验结果表明,VSF 在少步模型中对负面提示的遵循度显著优于先前方法,甚至在非少步模型中的 CFG 也能保持具竞争力的图像质量。代码和 ComfyUI 节点可在 https://github.com/weathon/VSF/tree/main 获取。

关键词

引用

@article{arxiv.2508.10931,
  title  = {VSF: Simple, Efficient, and Effective Negative Guidance in Few-Step Image Generation Models By Value Sign Flip},
  author = {Wenqi Guo and Shan Du},
  journal= {arXiv preprint arXiv:2508.10931},
  year   = {2026}
}