中文

StyleKeeper:使用负面视觉查询指导防止内容泄露

计算机视觉与模式识别 2025-10-09 v1

摘要

在文本到图像生成领域,扩散模型已成为强大的工具。最近,针对视觉提示(即使用图像作为提示)的研究使人们能够更精确地控制风格和内容。然而,现有方法常常会出现内容泄露,即视觉提示中不希望的元素会随着所需风格一起被转移。为解决此问题,我们1)扩展无条件引导(CFG)以利用交换自注意力机制,提出2)负面视觉查询指导(NVQG)以减少不必要内容的转移。NVQG通过有意模拟内容泄露场景(即交换视觉提示的查询而非键值)来生成负面得分。该方法简单而有效,显著减少了内容泄露。此外,我们提供了使用真实图像作为视觉提示的具体方案。通过在各种风格和文本提示上的广泛评估,我们的方法优于现有方法,既能反映参考样式,又能确保生成图像符合文本提示。我们的代码可在\href{https://github.com/naver-ai/StyleKeeper}{here}获取。

关键词

引用

@article{arxiv.2510.06827,
  title  = {StyleKeeper: Prevent Content Leakage using Negative Visual Query Guidance},
  author = {Jaeseok Jeong and Junho Kim and Gayoung Lee and Yunjey Choi and Youngjung Uh},
  journal= {arXiv preprint arXiv:2510.06827},
  year   = {2025}
}

备注

Accepted to ICCV 2025; CVPRW AI4CC 2024 (Best Paper + Oral)