生成式视觉提示:统一预训练生成模型的分布控制
计算机视觉与模式识别
2022-10-18 v2 图形学
机器学习
摘要
生成模型(如 GAN、扩散模型)以无监督方式学习底层数据分布。然而,许多感兴趣的应用需要从输出空间的特定区域采样,或在一系列特征上均匀采样。针对这些场景下的高效采样,我们提出生成式视觉提示(PromptGen),一种通过融合其他现成模型的知识来对预训练生成模型进行分布控制的框架。PromptGen 将控制定义为基于能量的模型(EBM),并通过可逆神经网络近似 EBM 以前馈方式采样图像,从而在推理时避免优化。我们的实验展示了 PromptGen 如何利用各种现成模型以受控和/或去偏的方式从多个无条件生成模型(如 StyleGAN2、StyleNeRF、扩散自编码器、NVAE)中高效采样:(1)以 CLIP 模型作为控制时,PromptGen 可采样由文本引导的图像;(2)以图像分类器作为控制时,PromptGen 可跨一组属性或属性组合对生成模型去偏;(3)以逆图形学模型作为控制时,PromptGen 可采样同一身份在不同姿态下的图像。(4)最后,PromptGen 揭示出 CLIP 模型作为控制时存在“报告偏差”,且 PromptGen 可进一步以迭代方式对该受控分布去偏。代码见 https://github.com/ChenWu98/Generative-Visual-Prompt。
引用
@article{arxiv.2209.06970,
title = {Generative Visual Prompt: Unifying Distributional Control of Pre-Trained Generative Models},
author = {Chen Henry Wu and Saman Motamed and Shaunak Srivastava and Fernando De la Torre},
journal= {arXiv preprint arXiv:2209.06970},
year = {2022}
}
备注
NeurIPS 2022