StyTr$^2$:基于 Transformer 的图像风格迁移
计算机视觉与模式识别
2022-04-04 v3 图像与视频处理
摘要
图像风格迁移的目标是在保持原始内容的同时,以风格参考图像引导,赋予图像艺术特征。由于卷积神经网络(CNN)的局部性,提取并维持输入图像的全局信息十分困难。因此,传统的神经风格迁移方法面临内容表征偏差的问题。为解决这一关键问题,我们通过提出一种名为 StyTr 的基于 Transformer 的方法,将输入图像的长程依赖纳入图像风格迁移的考量。与其他视觉任务中的视觉 Transformer 不同,StyTr 包含两个独立的 Transformer 编码器,分别生成内容与风格的特定域序列。在编码器之后,采用多层 Transformer 解码器根据风格序列对内容序列进行风格化。我们还分析了现有位置编码方法的不足,并提出内容感知位置编码(CAPE),其具有尺度不变性,更适用于图像风格迁移任务。定性与定量实验表明,相较于最先进的基于 CNN 和基于流的方法,所提出的 StyTr 具有有效性。代码与模型见 https://github.com/diyiiyiii/StyTR-2。
引用
@article{arxiv.2105.14576,
title = {StyTr$^2$: Image Style Transfer with Transformers},
author = {Yingying Deng and Fan Tang and Weiming Dong and Chongyang Ma and Xingjia Pan and Lei Wang and Changsheng Xu},
journal= {arXiv preprint arXiv:2105.14576},
year = {2022}
}
备注
Accepted by CVPR 2022