中文

通过融入词汇语义实现基于知识且可控的图像补全

计算机视觉与模式识别 2020-03-03 v1

摘要

在本文中,我们提出一种方法,即词汇语义图像补全(LSIC),它可能在艺术、设计、遗产保护等多个领域具有潜在应用。现有的图像补全过程仅考虑视觉上下文,具有高度主观性,可能触发不可预测的结果,这些结果看似合理但不忠实于基于知识的依据。为了实现既基于知识又可控制的补全过程,我们主张生成同时忠实于视觉与词汇语义上下文的结果,即图像中缺失区域或空白区域的描述(例如空洞描述)。LSIC 的一个主要挑战在于对视觉-语义上下文的结构进行建模与对齐,并在不同模态间进行转换。我们将此过程称为结构补全,由我们模型中的多粒度推理块实现。另一个挑战与单模态偏差有关,即当模型不使用文本描述也能生成看似合理的结果时发生。这可能是事实,因为现有数据集中图像的标注描述通常在语义上等价,因此训练时一个被掩码的图像仅对应一段配对文本。我们除设计已被过度探索的配对重建路径外,还设计了一条无监督非配对生成学习路径,以及一种多阶段训练策略,以缓解标注数据不足的问题。我们进行了大量定量与定性实验以及消融研究,揭示了所提 LSIC 的有效性。

关键词

引用

@article{arxiv.2003.00303,
  title  = {Grounded and Controllable Image Completion by Incorporating Lexical Semantics},
  author = {Shengyu Zhang and Tan Jiang and Qinghao Huang and Ziqi Tan and Zhou Zhao and Siliang Tang and Jin Yu and Hongxia Yang and Yi Yang and Fei Wu},
  journal= {arXiv preprint arXiv:2003.00303},
  year   = {2020}
}

备注

9 pages, 9 figures