中文

基于交换自注意力的视觉风格提示

计算机视觉与模式识别 2024-02-22 v2

摘要

在文本到图像生成不断发展的领域中,扩散模型已成为内容创作的强大工具。尽管具有卓越的能力,现有模型在实现具有一致风格的受控生成方面仍面临挑战,通常需要昂贵的微调,或者由于内容泄漏而常常无法充分转移视觉元素。为了解决这些挑战,我们提出了一种名为\ours 的新方法,旨在生成多样化的图像,同时保持特定的风格元素和细微差别。在去噪过程中,我们保留原始特征的查询(query),而在后期自注意力层中将键(key)和值(value)替换为参考特征的键和值。这种方法无需任何微调即可实现视觉风格提示,确保生成的图像保持忠实的风格。通过对各种风格和文本提示的广泛评估,我们的方法证明了其优于现有方法,最能反映参考图像的风格,并确保生成的图像最准确地匹配文本提示。我们的项目页面地址为 https://curryjung.github.io/VisualStylePrompt/。

关键词

引用

@article{arxiv.2402.12974,
  title  = {Visual Style Prompting with Swapping Self-Attention},
  author = {Jaeseok Jeong and Junho Kim and Yunjey Choi and Gayoung Lee and Youngjung Uh},
  journal= {arXiv preprint arXiv:2402.12974},
  year   = {2024}
}