中文

基于共享码VQGAN的高质量兼性图像补全

计算机视觉与模式识别 2022-04-06 v1

摘要

PICNet 开创了图像补全任务中生成多个多样结果的工作,但其需要仔细平衡 KL\mathcal{KL} 损失(多样性)与重建损失(质量),导致多样性与质量均有限。此外,基于 iGPT 的架构已被用于推断来自像素级预聚类调色板的离散空间中的分布,然而其无法直接生成高质量结果。在本工作中,我们提出一种新颖的兼性图像补全框架,能以快得多的推理速度同时实现高质量与多样性。我们设计的核心在于一个简单而有效的码共享机制,其在离散潜域中导出非常紧凑且富有表现力的图像表示。表示的紧凑性与丰富性进一步促进了后续 transformer 的部署,以在离散码域中有效学习如何合成与补全被掩码图像。基于 transformer 充分捕获的全局上下文与可用视觉区域,我们能够同时采样所有 token,这与基于 iGPT 工作的主流自回归方法完全不同,并带来了超过 100×\times 的推理加速。实验表明,我们的框架能高效且鲁棒地学习语义丰富的离散码,从而获得更好的图像重建质量。我们的多样图像补全框架在多个基准数据集上定量与定性均显著优于当前最优方法。

关键词

引用

@article{arxiv.2204.01931,
  title  = {High-Quality Pluralistic Image Completion via Code Shared VQGAN},
  author = {Chuanxia Zheng and Guoxian Song and Tat-Jen Cham and Jianfei Cai and Dinh Phung and Linjie Luo},
  journal= {arXiv preprint arXiv:2204.01931},
  year   = {2022}
}

备注

12 pages, 15 figures