中文

预训练即你所需要的一切:面向图像到图像翻译

计算机视觉与模式识别 2022-05-26 v1

摘要

我们提出利用预训练来提升通用图像到图像翻译性能。已有的图像到图像翻译方法通常需要专门的结构设计并从零开始训练各自的翻译模型,在复杂场景的高质量生成上举步维艰,尤其在配对训练数据不充足时。本文将每个图像到图像翻译问题视为下游任务,并引入一个简单通用的框架,将预训练的扩散模型适配于各类图像到图像翻译。我们还提出对抗训练以增强扩散模型训练中的纹理合成,并结合归一化引导采样来改善生成质量。我们在 ADE20K、COCO-Stuff 和 DIODE 等具有挑战性的基准上针对多种任务给出了广泛的实证对比,表明所提出的基于预训练的图像到图像翻译(PITI)能够合成出前所未有真实度与保真度的图像。

关键词

引用

@article{arxiv.2205.12952,
  title  = {Pretraining is All You Need for Image-to-Image Translation},
  author = {Tengfei Wang and Ting Zhang and Bo Zhang and Hao Ouyang and Dong Chen and Qifeng Chen and Fang Wen},
  journal= {arXiv preprint arXiv:2205.12952},
  year   = {2022}
}

备注

Project Page: https://tengfei-wang.github.io/PITI/index.html