ASSET:基于 Transformer 的高分辨率自回归语义场景编辑
计算机视觉与模式识别
2022-05-25 v1 图形学
摘要
我们提出 ASSET,一种根据用户对其语义分割图的编辑自动修改输入高分辨率图像的神经架构。我们的架构基于带有新颖注意力机制的 Transformer。我们的核心思想是在高分辨率下稀疏化 Transformer 的注意力矩阵,并以在低图像分辨率下提取的稠密注意力作为引导。此前的注意力机制要么计算开销过大而无法处理高分辨率图像,要么在特定图像区域内过度受限而妨碍长距离交互,而我们新颖的注意力机制兼具计算高效与有效性。我们的稀疏化注意力机制能够捕捉长距离交互与上下文,从而合成场景中有趣的现象,例如景观在水面上的倒影或与景观其余部分一致的植物群,这些是此前的卷积网络与 Transformer 方法无法可靠生成的。我们给出了定性、定量结果以及用户研究,证明了我们方法的有效性。
引用
@article{arxiv.2205.12231,
title = {ASSET: Autoregressive Semantic Scene Editing with Transformers at High Resolutions},
author = {Difan Liu and Sandesh Shetty and Tobias Hinz and Matthew Fisher and Richard Zhang and Taesung Park and Evangelos Kalogerakis},
journal= {arXiv preprint arXiv:2205.12231},
year = {2022}
}
备注
SIGGRAPH 2022 - Journal Track