中文

MaGIC:多模态引导的图像补全

计算机视觉与模式识别 2023-11-22 v2

摘要

朴素的图像补全方法对大面积缺失区域表现出敏感性,这归因于可用于合理生成的参考信息有限。为缓解此问题,现有方法引入额外线索作为图像补全的引导。尽管有所改进,这些方法通常局限于采用单一模态(如分割图或草图),缺乏利用多模态以实现更合理补全的可扩展性。本文提出一种新颖、简洁而有效的多模态引导图像补全方法,称为 MaGIC,其不仅支持广泛的单一模态作为引导(如文本、Canny 边缘、草图、分割、深度和姿态),还适应这些模态的任意自定义组合(即任意多模态)用于图像补全。为构建 MaGIC,我们首先引入模态特定条件 U-Net(MCU-Net),将单模态信号注入 U-Net 去噪器以实现单模态引导图像补全。随后,我们设计了一种一致模态混合(CMB)方法,通过隐空间中的梯度引导来利用多个已学习 MCU-Net 中编码的模态信号。我们的 CMB 无需训练,从而避免了不同模态繁琐的联合重训练,这是 MaGIC 在实现容纳新模态补全方面具有卓越灵活性的关键。实验显示了 MaGIC 相对于最先进方法的优越性及其对各种补全任务的泛化能力。我们的项目(含代码与模型)可在 yeates.github.io/MaGIC-Page/ 获取。

关键词

引用

@article{arxiv.2305.11818,
  title  = {MaGIC: Multi-modality Guided Image Completion},
  author = {Yongsheng Yu and Hao Wang and Tiejian Luo and Heng Fan and Libo Zhang},
  journal= {arXiv preprint arXiv:2305.11818},
  year   = {2023}
}

备注

23 pages, 15 figures