基于频率控制的扩散模型用于通用的文本引导图像到图像翻译
计算机视觉与模式识别
2025-03-28 v2
摘要
最近,大规模文本到图像(T2I)扩散模型已成为图像到图像翻译(I2I)的强大工具,允许通过用户提供的文本提示实现开放领域的图像翻译。本文提出了频率控制扩散模型(FCDiffusion),一个基于扩散的端到端框架,从频率域视角提供了文本引导I2I的新颖解决方案。我们框架的核心是一个基于离散余弦变换(DCT)的特征空间频率域滤波模块,该模块在DCT域中对源图像的隐层特征进行滤波,生成具有不同DCT谱波段的滤波后图像特征,作为不同的控制信号输入到预训练的潜在扩散模型中。我们揭示了不同DCT谱波段的控制信号在不同关联性(例如风格、结构、布局、轮廓等)下桥接源图像与T2I生成图像,从而实现强调不同I2I关联性的多样化I2I应用,包括风格引导的内容创建、图像语义操控、图像场景翻译和图像风格翻译。与相关方法不同,FCDiffusion通过在推理时在不同频率控制分支之间切换,构建了一个适用于多样化图像翻译任务的统一文本引导I2I框架。通过大量定性和定量实验,我们证明了我们方法在文本引导I2I方面的有效性和优越性。我们的项目已公开:https://xianggao1102.github.io/FCDiffusion/。
引用
@article{arxiv.2407.03006,
title = {Frequency-Controlled Diffusion Model for Versatile Text-Guided Image-to-Image Translation},
author = {Xiang Gao and Zhengbo Xu and Junhan Zhao and Jiaying Liu},
journal= {arXiv preprint arXiv:2407.03006},
year = {2025}
}
备注
Proceedings of the 38th AAAI Conference on Artificial Intelligence (AAAI 2024)