基于高分辨率稀疏注意力机制的语义布局编辑
计算机视觉与模式识别
2022-04-19 v4
摘要
我们解决了语义图像布局编辑问题,旨在通过对输入图像的语义标签图进行编辑来操纵该图像。该任务的一个核心问题是如何将视觉细节从输入图像转移到新的语义布局,同时使生成的图像在视觉上真实。近期关于跨域对应学习的研究在基于稠密注意力的扭曲全局布局转移方面显示出有前景的结果。然而,由于分辨率限制以及对应关系缺乏平滑性约束,该方法容易丢失纹理细节。为使这一范式适应布局编辑任务,我们提出了一种高分辨率稀疏注意力模块,可将视觉细节有效转移到分辨率高达 512x512 的新布局。为了进一步提升视觉质量,我们引入了一种由语义编码器和用于由粗到细合成的两级解码器组成的新颖生成器架构。在 ADE20k 和 Places365 数据集上的实验表明,我们提出的方法相比现有的修复和布局编辑方法取得了显著改进。
引用
@article{arxiv.2012.07288,
title = {Semantic Layout Manipulation with High-Resolution Sparse Attention},
author = {Haitian Zheng and Zhe Lin and Jingwan Lu and Scott Cohen and Jianming Zhang and Ning Xu and Jiebo Luo},
journal= {arXiv preprint arXiv:2012.07288},
year = {2022}
}
备注
19 pages, 22 figures