中文

SAIR:学习语义感知的隐式表示

计算机视觉与模式识别 2023-10-16 v1

摘要

图像的隐式表示能够将连续域中的任意坐标映射到其对应的颜色值,展现出强大的图像重建能力。然而,现有的隐式表示方法仅关注建立连续外观映射,忽略了跨像素的语义信息的连续性。因此,当输入图像中的语义信息受损(例如大片区域缺失)时,它们难以获得理想的重建结果。为解决该问题,我们提出学习语义感知的隐式表示 (SAIR),即令每个像素的隐式表示同时依赖于其外观与语义信息(例如该像素属于哪个物体)。为此,我们提出一个包含两模块的框架:(1) 为大面积缺失的受损图像建立语义隐式表示 (SIR)。给定连续域中的任意坐标,我们可得到其对应的文本对齐嵌入,指示该像素所属物体。(2) 基于 SIR 建立外观隐式表示 (AIR)。给定连续域中的任意坐标,无论该像素在输入中是否缺失,我们均可重建其颜色。我们在图像修复任务上验证了这一新颖的语义感知隐式表示方法,大量实验表明我们的方法大幅超越最先进的 (state-of-the-art) 方法。

关键词

引用

@article{arxiv.2310.09285,
  title  = {SAIR: Learning Semantic-aware Implicit Representation},
  author = {Canyu Zhang and Xiaoguang Li and Qing Guo and Song Wang},
  journal= {arXiv preprint arXiv:2310.09285},
  year   = {2023}
}