扩散模型中的风格注入:一种无需训练的大规模扩散模型风格迁移适配方法
计算机视觉与模式识别
2024-03-21 v2
摘要
尽管扩散模型具有令人印象深刻的生成能力,但现有的基于扩散模型的风格迁移方法需要推理阶段的优化(例如微调或风格的文本反转),这非常耗时,或者未能利用大规模扩散模型的生成能力。为了解决这些问题,我们引入了一种基于预训练大规模扩散模型的全新艺术风格迁移方法,无需任何优化。具体而言,我们按照交叉注意力机制的工作方式操纵自注意力层的特征;在生成过程中,将内容的键和值替换为风格图像的键和值。这种方法为风格迁移提供了几个理想的特性,包括:1)通过将相似的风格迁移到相似的图像块中来保留内容,以及2)基于内容和风格图像之间局部纹理(例如边缘)的相似性来迁移风格。此外,我们引入了查询保留和注意力温度缩放以缓解原始内容被破坏的问题,并引入了初始潜空间的Adaptive Instance Normalization(AdaIN)以处理颜色不和谐(未能迁移风格颜色)的问题。我们的实验结果表明,我们提出的方法在传统和基于扩散模型的风格迁移基线上均超越了SOTA方法。
引用
@article{arxiv.2312.09008,
title = {Style Injection in Diffusion: A Training-free Approach for Adapting Large-scale Diffusion Models for Style Transfer},
author = {Jiwoo Chung and Sangeek Hyun and Jae-Pil Heo},
journal= {arXiv preprint arXiv:2312.09008},
year = {2024}
}
备注
Accepted to CVPR 2024. Project page: https://jiwoogit.github.io/StyleID_site