中文

InstaFormer:基于 Transformer 的实例感知图像到图像翻译

计算机视觉与模式识别 2022-03-31 v1

摘要

我们提出一种新颖的基于 Transformer 的网络架构,用于实例感知图像到图像翻译,称为 InstaFormer,以有效整合全局与实例级信息。通过将图像中提取的内容特征视为令牌(token),我们的网络借助 Transformer 中自注意力模块考量上下文信息,从而发现内容特征的全局共识。通过用依据边界框信息从内容特征提取的实例级特征增强此类令牌,我们的框架能够学习物体实例与全局图像之间的交互,从而提升实例感知能力。我们将标准 Transformer 中的层归一化(LayerNorm)替换为自适应实例归一化(AdaIN),以实现带风格码的多模态翻译。此外,为提升物体区域的实例感知与翻译质量,我们提出在输入与翻译图像之间定义的实例级内容对比损失。我们通过实验证明了 InstaFormer 相对于最新方法的有效性,并提供了充分的消融研究。

关键词

引用

@article{arxiv.2203.16248,
  title  = {InstaFormer: Instance-Aware Image-to-Image Translation with Transformer},
  author = {Soohyun Kim and Jongbeom Baek and Jihye Park and Gyeongnyeon Kim and Seungryong Kim},
  journal= {arXiv preprint arXiv:2203.16248},
  year   = {2022}
}

备注

Accepted to CVPR 2022