AttenST:一种基于预训练扩散模型的无训练注意力驱动风格迁移框架
计算机视觉与模式识别
2025-03-11 v1
摘要
尽管扩散模型在风格迁移任务中取得了显著进展,但现有方法通常在推理阶段依赖对预训练模型的微调或优化,导致计算成本高昂,且在平衡内容保持与风格融合方面存在挑战。为解决这些局限性,我们提出了 AttenST,一种无训练的注意力驱动风格迁移框架。具体而言,我们提出了一种风格引导的自注意力机制,通过保留内容图像的 query 并将其 key 和 value 替换为来自风格图像的 key 和 value,使自注意力以参考风格为条件,从而实现有效的风格特征融合。为缓解反演过程中的风格信息丢失,我们引入了一种风格保持反演策略,通过多次重采样步骤提升反演精度。此外,我们提出了内容感知自适应实例归一化,将内容统计信息整合到归一化过程中,以优化风格融合同时缓解内容退化。进一步地,我们引入了双特征交叉注意力机制来融合内容与风格特征,确保结构保真度与风格表达的和谐统一。大量实验表明,AttenST 优于现有方法,在风格迁移数据集上取得了 state-of-the-art 的性能。
引用
@article{arxiv.2503.07307,
title = {AttenST: A Training-Free Attention-Driven Style Transfer Framework with Pre-Trained Diffusion Models},
author = {Bo Huang and Wenlun Xu and Qizhuo Han and Haodong Jing and Ying Li},
journal= {arXiv preprint arXiv:2503.07307},
year = {2025}
}