基于 Transformer 的高保真多元图像补全
计算机视觉与模式识别
2021-03-26 v1 图形学
摘要
得益于强大的纹理建模能力,卷积神经网络(CNNs)在图像补全上取得了巨大进展。然而,由于一些固有属性(如局部归纳偏置、空间不变核),CNNs 在理解全局结构或自然支持多元补全方面表现不佳。近期,transformers 展示了建模长程关系与生成多样结果的能力,但其计算复杂度相对于输入长度呈二次方增长,从而阻碍了在高分辨率图像处理中的应用。本文将两者优势结合用于多元图像补全:用 transformer 进行外观先验重建,用 CNN 进行纹理补充。前者 transformer 恢复多元连贯结构及一些粗纹理,后者 CNN 在高分辨率掩码图像引导下增强粗先验的局部纹理细节。所提方法在以下三方面大幅优于最优方法:1)即便与确定性补全方法相比,图像保真度上的大幅性能提升;2)多元补全更好的多样性与更高保真度;3)在大掩码和通用数据集(如 ImageNet)上的卓越泛化能力。
引用
@article{arxiv.2103.14031,
title = {High-Fidelity Pluralistic Image Completion with Transformers},
author = {Ziyu Wan and Jingbo Zhang and Dongdong Chen and Jing Liao},
journal= {arXiv preprint arXiv:2103.14031},
year = {2021}
}
备注
Project Page: http://raywzy.com/ICT