GLIDE:基于文本引导扩散模型迈向真实感图像生成与编辑
计算机视觉与模式识别
2022-03-09 v3 图形学
机器学习
摘要
扩散模型近来被证明可生成高质量合成图像,尤其当配合一种在多样性与保真度之间权衡的引导技术时。我们探索扩散模型用于文本条件图像合成问题,并比较两种不同引导策略:CLIP 引导和免分类器引导。我们发现后者在真实感和标题相似性上更受人类评估者青睐,且常生成真实感样本。使用免分类器引导的 35 亿参数文本条件扩散模型的样本比 DALL-E 的样本更受人类评估者喜爱,即使后者使用了昂贵的 CLIP 重排序。此外,我们发现我们的模型可微调以执行图像修复,从而实现强大的文本驱动图像编辑。我们在筛选后的数据集上训练了更小的模型,并在 https://github.com/openai/glide-text2im 发布了代码与权重。
引用
@article{arxiv.2112.10741,
title = {GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models},
author = {Alex Nichol and Prafulla Dhariwal and Aditya Ramesh and Pranav Shyam and Pamela Mishkin and Bob McGrew and Ilya Sutskever and Mark Chen},
journal= {arXiv preprint arXiv:2112.10741},
year = {2022}
}
备注
20 pages, 18 figures