利用文本到图像模型实现单步图像转换
计算机视觉与模式识别
2024-03-19 v1 图形学
机器学习
摘要
在本工作中,我们解决了现有条件扩散模型的两个局限性:由于迭代去噪过程导致的推理速度缓慢,以及依赖配对数据进行模型微调。为了解决这些问题,我们引入了一种通用方法,通过对抗学习目标将单步扩散模型适配到新任务和新领域。具体而言,我们将原始潜在扩散模型的各个模块整合为一个具有少量可训练权重的端到端生成器网络,增强了其保留输入图像结构的能力,同时减少了过拟合。我们证明,在非配对设置下,对于日到夜转换以及添加/去除雾、雪、雨等天气效果等各种场景转换任务,我们的模型CycleGAN-Turbo优于现有的基于GAN和基于扩散的方法。我们将方法扩展到配对设置,其中我们的模型pix2pix-Turbo在Sketch2Photo和Edge2Image任务上与Control-Net等近期工作表现相当,但仅需单步推理。这项工作表明,单步扩散模型可以作为一系列GAN学习目标的强大骨干网络。我们的代码和模型可在 https://github.com/GaParmar/img2img-turbo 获取。
引用
@article{arxiv.2403.12036,
title = {One-Step Image Translation with Text-to-Image Models},
author = {Gaurav Parmar and Taesung Park and Srinivasa Narasimhan and Jun-Yan Zhu},
journal= {arXiv preprint arXiv:2403.12036},
year = {2024}
}
备注
Github: https://github.com/GaParmar/img2img-turbo