pOps:基于照片启发的扩散算子
计算机视觉与模式识别
2024-06-04 v1
摘要
文本导向图像生成使人们能够从文本描述中创建视觉内容。然而,某些视觉概念无法通过语言有效表达。这催生了对利用CLIP图像嵌入空间进行更具视觉性的任务的重新关注,诸如IP-Adapter等方法。有趣的是,CLIP图像嵌入空间被证明具有语义意义,其中在该空间中的线性运算会产生语义上有意义的结果。然而,这些运算的具体含义在不同图像之间会不可预测地变化。为了充分利用这一潜力,我们引入pOps—a一个在CLIP图像嵌入上训练特定语义算子的框架。每个pOps算子都建立在预训练的扩散先验模型之上。虽然扩散先验模型最初是用于在文本嵌入和图像嵌入之间进行映射,但我们展示了它可以被调谐以适应新的输入条件,从而成为一个扩散算子。直接在图像嵌入上工作不仅提高了我们学习语义运算的能力,还允许我们在需要时直接使用文本CLIP损失作为额外的监督。我们展示,pOps可以用于学习各种具有不同语义含义的照片启发算子,凸显了我们提出方法的语义多样性和潜力。
引用
@article{arxiv.2406.01300,
title = {pOps: Photo-Inspired Diffusion Operators},
author = {Elad Richardson and Yuval Alaluf and Ali Mahdavi-Amiri and Daniel Cohen-Or},
journal= {arXiv preprint arXiv:2406.01300},
year = {2024}
}
备注
Project Page: https://popspaper.github.io/pOps/