中文

NÜWA-LIP: 基于无缺陷 VQGAN 的语言引导图像修复

计算机视觉与模式识别 2022-02-11 v1

摘要

语言引导的图像修复旨在根据文本的指导填充图像的缺陷区域,同时保持非缺陷区域不变。然而,现有模型的编码过程要么受到缺陷区域感受野扩散的影响,要么遭受非缺陷区域信息损失的影响,从而导致视觉上不吸引人的修复结果。为了解决上述问题,本文通过将无缺陷 VQGAN (DF-VQGAN) 与多视角序列到序列 (MP-S2S) 相结合,提出了 NÜWA-LIP。特别是,DF-VQGAN 引入了相对估计来控制感受野扩散,并采用对称连接来保护信息。MP-S2S 进一步增强了来自互补视角的视觉信息,包括低级像素和高级标记。实验表明,DF-VQGAN 比 VQGAN 表现出更强的鲁棒性。为了评估我们模型的修复性能,我们建立了 3 个开放域基准,在这些基准上,NÜWA-LIP 也优于近期强大的基线模型。

关键词

引用

@article{arxiv.2202.05009,
  title  = {N\"UWA-LIP: Language Guided Image Inpainting with Defect-free VQGAN},
  author = {Minheng Ni and Chenfei Wu and Haoyang Huang and Daxin Jiang and Wangmeng Zuo and Nan Duan},
  journal= {arXiv preprint arXiv:2202.05009},
  year   = {2022}
}

备注

10 pages, 6 figures