基于视觉 Transformer 的细粒度图像风格迁移
计算机视觉与模式识别
2022-10-12 v1 人工智能
摘要
随着卷积神经网络的发展,图像风格迁移引起了越来越多的关注。然而,现有大多数方法采用全局特征变换将风格模式迁移到内容图像中(例如 AdaIN 和 WCT)。这种设计通常会破坏输入图像的空间信息,并且无法将细粒度的风格模式迁移到风格迁移结果中。为了解决这个问题,我们提出了一种新颖的 STyle TRansformer (STTR) 网络,该网络将内容图像和风格图像都分解为视觉 token,以实现细粒度的风格变换。具体而言,我们的 STTR 采用了两种注意力机制。我们首先提出使用自注意力对内容和风格 token 进行编码,使得相似的 token 可以被分组并一起学习。然后,我们在内容和风格 token 之间采用交叉注意力,以促进细粒度的风格变换。为了将 STTR 与现有方法进行比较,我们在 Amazon Mechanical Turk (AMT) 上进行了用户研究,共有 50 名人类受试者参与,总计 1,000 次投票。大量评估证明了所提出的 STTR 在生成视觉上令人愉悦的风格迁移结果方面的有效性和效率。
引用
@article{arxiv.2210.05176,
title = {Fine-Grained Image Style Transfer with Visual Transformers},
author = {Jianbo Wang and Huan Yang and Jianlong Fu and Toshihiko Yamasaki and Baining Guo},
journal= {arXiv preprint arXiv:2210.05176},
year = {2022}
}
备注
24 pages, 15 figures