中文

ITTR:基于 Transformer 的无配对图像到图像翻译

计算机视觉与模式识别 2022-03-31 v1

摘要

无配对图像到图像翻译旨在无配对训练数据的情况下将源域图像翻译至目标域。通过利用 CNN 提取局部语义,已发展出多种技术以提升翻译性能。然而,基于 CNN 的生成器缺乏捕捉长程依赖以充分利用全局语义的能力。近来,视觉 Transformer 已被广泛研究用于识别任务。尽管颇具吸引力,但由于生成难度与计算限制,将基于识别的视觉 Transformer 简单迁移至图像到图像翻译并不合适。本文中,我们提出了一种高效且有效的基于 Transformer 的无配对图像到图像翻译架构(ITTR)。它有两个主要设计:1)混合感知块(HPB),用于来自不同感受野的 token 混合以利用全局语义;2)双重剪枝自注意力(DPSA),以大幅降低计算复杂度。我们的 ITTR 在六个基准数据集上的无配对图像到图像翻译任务中优于当前最优方法(SOTA)。

关键词

引用

@article{arxiv.2203.16015,
  title  = {ITTR: Unpaired Image-to-Image Translation with Transformers},
  author = {Wanfeng Zheng and Qiang Li and Guoxin Zhang and Pengfei Wan and Zhongyuan Wang},
  journal= {arXiv preprint arXiv:2203.16015},
  year   = {2022}
}

备注

18 pages, 7 figures, 5 tables