中文

TALE:通过自适应潜在操控与能量引导优化实现无需训练的跨域图像合成

计算机视觉与模式识别 2024-08-08 v1 多媒体

摘要

我们提出了TALE,一个新颖的无需训练框架,利用文本到图像扩散模型的生成能力来解决跨域图像合成任务,该任务专注于将用户指定的对象无缝融入指定的视觉语境中,无论域差异如何。先前的方法通常涉及训练辅助网络或在定制数据集上微调扩散模型,这些方法成本高昂且可能损害预训练扩散模型的鲁棒文本和视觉先验。一些近期工作尝试通过提出依赖于操控注意力图来隐式控制去噪过程的无需训练变通方法来打破这一障碍。然而,通过注意力图进行合成并不一定能产生期望的合成结果。这些方法只能保留部分语义信息,通常不足以保留输入对象的身份特征,或在生成图像中表现出有限的背景-对象风格适应性。相比之下,TALE是一种直接在潜在空间上操作的新方法,为合成过程提供显式且有效的指导以解决这些问题。具体而言,TALE配备了两种机制,分别称为自适应潜在操控和能量引导潜在优化。前者通过在对应时间步直接利用背景和前景潜在来构建有利于启动和引导合成过程的噪声潜在,后者利用指定的能量函数进一步优化符合特定条件的中间潜在,以补充前者生成期望的最终结果。我们的实验表明TALE超越了先前基线,在各种照片级真实和艺术领域中达到了最先进的图像引导合成性能。

关键词

引用

@article{arxiv.2408.03637,
  title  = {TALE: Training-free Cross-domain Image Composition via Adaptive Latent Manipulation and Energy-guided Optimization},
  author = {Kien T. Pham and Jingye Chen and Qifeng Chen},
  journal= {arXiv preprint arXiv:2408.03637},
  year   = {2024}
}

备注

The 32nd ACM Multimedia Conference (MM '24)