PTDiffusion:利用相位转移扩散模型生成视错觉隐藏图像的免费午餐
计算机视觉与模式识别
2025-04-21 v5
摘要
视错觉隐藏图像是一种有趣的视觉感知现象,其中一幅图像以观众无法立即察觉的方式巧妙地融入另一幅图像中。基于现成的文本到图像 (T2I) 扩散模型,我们提出了一种新颖的免训练文本引导图像到图像 (I2I) 转换框架,称为相位转移扩散模型 (PTDiffusion),用于隐藏艺术合成。PTDiffusion 将输入参考图像和谐地嵌入到由文本提示描述的任意场景中,生成展现出参考图像隐藏视觉线索的错觉图像。我们方法的核心是一个即插即用的相位转移机制,该机制动态且渐进地将扩散特征的相位谱从重建参考图像的去噪过程转移到采样生成错觉图像的过程中,实现了参考结构信息与文本语义信息在扩散模型潜在空间中的深度融合。此外,我们提出了异步相位转移,以实现对隐藏内容可辨识程度的灵活控制。我们的方法绕过了任何模型训练和微调过程,同时正如大量定性和定量实验所证明的那样,在错觉图像合成的图像生成质量、文本保真度、视觉可辨识度和上下文自然度方面,均大幅优于相关的文本引导 I2I 方法。我们的项目在此网页公开可用:\href{https://xianggao1102.github.io/PTDiffusion_webpage/}{this web page}。
引用
@article{arxiv.2503.06186,
title = {PTDiffusion: Free Lunch for Generating Optical Illusion Hidden Pictures with Phase-Transferred Diffusion Model},
author = {Xiang Gao and Shuai Yang and Jiaying Liu},
journal= {arXiv preprint arXiv:2503.06186},
year = {2025}
}
备注
Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2025)