使用潜变量 CLIP 控制潜变量扩散
计算机视觉与模式识别
2025-03-12 v1 人工智能
机器学习
图像与视频处理
机器学习
摘要
潜变量扩散模型(LDM)并非在图像域中执行文本条件去噪,而是在变分自编码器(VAE)的潜空间中运行,从而以降低的计算成本实现更高效的处理。然而,尽管扩散过程已移至潜空间,许多图像处理任务所使用的对比语言-图像预训练(CLIP)模型仍运行于像素空间。此类操作需要在处理前对潜变量图像进行昂贵的 VAE 解码。本文提出 Latent-CLIP,一种直接在潜空间中操作的 CLIP 模型。我们在 2.7B 对潜变量图像与描述性文本对上训练 Latent-CLIP,并证明其在 ImageNet 基准测试以及 LDM 生成的 ImageNet 版本上,均达到了同等规模 CLIP 模型的零样本分类性能,展示了其在评估真实与生成内容方面的有效性。此外,我们为基于奖励的噪声优化(ReNO)构建了 Latent-CLIP 奖励,并证明其在 GenEval 和 T2I-CompBench 上的性能与对应的 CLIP 奖励相当,同时将整个流水线的成本降低了 21%。最后,我们使用 Latent-CLIP 引导生成远离有害内容,在不当图像提示(I2P)基准测试和自定义评估上取得了强劲性能,且无需执行解码中间图像的昂贵步骤。
引用
@article{arxiv.2503.08455,
title = {Controlling Latent Diffusion Using Latent CLIP},
author = {Jason Becker and Chris Wendler and Peter Baylies and Robert West and Christian Wressnegger},
journal= {arXiv preprint arXiv:2503.08455},
year = {2025}
}