中文

在Transformer中减少信息损失以实现多元化图像修复

计算机视觉与模式识别 2022-05-17 v2 图形学

摘要

Transformer近期在多元化图像修复中取得了巨大成功。然而,我们发现现有基于Transformer的方案将每个像素视为一个token,因此面临两方面的信息损失问题:1)为效率考虑将输入图像下采样到极低分辨率,造成信息损失及掩码区域边界的额外错位。2)将 2563256^3 的RGB像素量化为少量(如512个)量化像素,量化像素的索引被用作Transformer的输入token和预测目标。尽管使用额外的CNN网络对低分辨率结果上采样并细化,但难以找回丢失的信息。为尽可能保留输入信息,我们提出一种新的基于Transformer的框架“PUT”。具体而言,为避免输入下采样同时保持计算效率,我们设计了基于块的自动编码器P-VQVAE,其编码器将掩码图像转换为不重叠的块token,解码器从修复后的token中恢复掩码区域同时保持未掩码区域不变。为消除量化导致的信息损失,应用了非量化Transformer(UQ-Transformer),它直接以P-VQVAE编码器的特征作为输入而不经量化,并仅将量化token作为预测目标。大量实验表明,PUT在图像保真度上大幅优于SOTA方法,尤其对于大掩码区域和复杂大规模数据集。代码见 https://github.com/liuqk3/PUT

关键词

引用

@article{arxiv.2205.05076,
  title  = {Reduce Information Loss in Transformers for Pluralistic Image Inpainting},
  author = {Qiankun Liu and Zhentao Tan and Dongdong Chen and Qi Chu and Xiyang Dai and Yinpeng Chen and Mengchen Liu and Lu Yuan and Nenghai Yu},
  journal= {arXiv preprint arXiv:2205.05076},
  year   = {2022}
}

备注

CVPR 2022, code is available at https://github.com/liuqk3/PUT