中文

StyTr$^2$:基于 Transformer 的图像风格迁移

计算机视觉与模式识别 2022-04-04 v3 图像与视频处理

摘要

图像风格迁移的目标是在保持原始内容的同时,以风格参考图像引导,赋予图像艺术特征。由于卷积神经网络(CNN)的局部性,提取并维持输入图像的全局信息十分困难。因此,传统的神经风格迁移方法面临内容表征偏差的问题。为解决这一关键问题,我们通过提出一种名为 StyTr2^2 的基于 Transformer 的方法,将输入图像的长程依赖纳入图像风格迁移的考量。与其他视觉任务中的视觉 Transformer 不同,StyTr2^2 包含两个独立的 Transformer 编码器,分别生成内容与风格的特定域序列。在编码器之后,采用多层 Transformer 解码器根据风格序列对内容序列进行风格化。我们还分析了现有位置编码方法的不足,并提出内容感知位置编码(CAPE),其具有尺度不变性,更适用于图像风格迁移任务。定性与定量实验表明,相较于最先进的基于 CNN 和基于流的方法,所提出的 StyTr2^2 具有有效性。代码与模型见 https://github.com/diyiiyiii/StyTR-2。

关键词

引用

@article{arxiv.2105.14576,
  title  = {StyTr$^2$: Image Style Transfer with Transformers},
  author = {Yingying Deng and Fan Tang and Weiming Dong and Chongyang Ma and Xingjia Pan and Lei Wang and Changsheng Xu},
  journal= {arXiv preprint arXiv:2105.14576},
  year   = {2022}
}

备注

Accepted by CVPR 2022