FBSDiff:扩散特征频带替换的即插即用方法,用于高可控性文本驱动图像转换
计算机视觉与模式识别
2025-11-18 v6 人工智能
摘要
大规模文本到图像扩散模型是生成式 AI 和多模态技术演进中的里程碑式突破,能够通过自然语言文本提示生成精彩的图像。然而,此类模型缺乏可控性的问题限制了其在真实内容创作中的实际应用。因此,研究重点转向利用参考图像来控制文本到图像合成,这也被视为根据文本提示操作(或编辑)参考图像,即文本驱动的图像到图像转换。本文贡献了一种新颖、简洁且高效的方法,以即插即用方式将预训练的大规模文本到图像(T2I)扩散模型适配到图像到图像(I2I)范式中,实现了高质量且通用的文本驱动 I2I 转换,无需任何模型训练、微调或在线优化过程。为了用参考图像指导 T2I 生成,我们提出在 DCT 频谱空间中分解具有不同频带的扩散特征中的多样化引导因素,并据此设计了一种新颖的频带替换层,以即插即用方式实现参考图像对 T2I 生成结果的动态控制。我们证明,通过调整替换频带的类型和带宽,我们的方法可以灵活控制参考图像的引导因素和引导强度。广泛的定性和定量实验验证了我们方法在 I2I 转换视觉质量、通用性和可控性方面相比相关方法的优越性。代码公开可获取:https://github.com/XiangGao1102/FBSDiff。
引用
@article{arxiv.2408.00998,
title = {FBSDiff: Plug-and-Play Frequency Band Substitution of Diffusion Features for Highly Controllable Text-Driven Image Translation},
author = {Xiang Gao and Jiaying Liu},
journal= {arXiv preprint arXiv:2408.00998},
year = {2025}
}
备注
Accepted conference paper of ACM MM 2024