中文

不要凝视黑暗:用于多元化图像补全的潜在编码

计算机视觉与模式识别 2024-10-14 v2

摘要

我们提出了一种基于离散潜在编码生成框架的大掩码多元化图像补全方法。我们的方法仅在图像的可见位置执行计算,从而学习离散化为 token 的潜在先验。这是通过一个限制性部分编码器(预测每个可见块的 token 标签)、一个双向 Transformer(仅通过观察这些 token 来推断缺失标签)以及一个专门的合成网络(将 token 与部分图像先验耦合,即使在极端掩码设置下也能生成连贯且多元化的完整图像)来实现的。在公共基准上的实验验证了我们的设计选择,所提出的方法在视觉质量和多样性指标上均优于强基线。

关键词

引用

@article{arxiv.2403.18186,
  title  = {Don't Look into the Dark: Latent Codes for Pluralistic Image Inpainting},
  author = {Haiwei Chen and Yajie Zhao},
  journal= {arXiv preprint arXiv:2403.18186},
  year   = {2024}
}

备注

cvpr 2024