FBSDiff++:基于频率带替换的高效且高度可控文本驱动图像到图像翻译
计算机视觉与模式识别
2026-01-28 v1
摘要
随着大规模文本到图像(T2I)扩散模型在开放域图像创建方面取得显著进展,越来越多关注其向文本驱动图像到图像(I2I)翻译的自然延伸,其中源图像作为生成图像的视觉指导,除文本提示提供的文本指导外。我们提出 FBSDiff,一种全新的框架从频率域视角将现成的 T2I 扩散模型适用于 I2I 范式。通过动态替换扩散特征的频率带,FBSDiff 实现了灵活且高度可控的文本驱动 I2I,采用即插即用方式(无需模型训练、微调或在线优化),通过逐步替换潜在扩散特征的低频带、中频带和高频带,分别实现外观引导、布局引导和轮廓引导的 I2I 翻译。此外,FBSDiff 通过调节替换频率带的带宽,灵活实现对 I2I 关联强度的连续控制。为进一步提升图像翻译的效率、灵活性和功能性,我们提出 FBSDiff++ 在 FBSDiff 基础上进行改进,主要在三个方面:(1)通过优化模型结构大幅加快推理速度(推理速度提升 8.9 倍);(2)改进频率带替换模块,支持任意分辨率和宽高比的输入源图像;(3)通过对核心方法进行细微调整,将模型功能扩展到局部图像操作和风格特定内容创建。广泛的定性和定量实验验证了 FBSDiff++ 在 I2I 翻译视觉质量、效率、灵活性和可控性方面优于相关先进方法。
引用
@article{arxiv.2601.19115,
title = {FBSDiff++: Improved Frequency Band Substitution of Diffusion Features for Efficient and Highly Controllable Text-Driven Image-to-Image Translation},
author = {Xiang Gao and Yunpeng Jia},
journal= {arXiv preprint arXiv:2601.19115},
year = {2026}
}