中文

DejaVu:用于增强密集预测的条件再生学习

计算机视觉与模式识别 2023-03-31 v2

摘要

我们提出 DejaVu,一种新颖的框架,其在训练时利用条件图像再生作为额外监督,以改进用于分割、深度估计和表面法线预测等密集预测任务的深度网络。首先,我们对输入图像进行编辑遮蔽(redaction),通过稀疏采样或选择性频率去除来移除某些结构信息。接下来,我们使用条件再生器,其以编辑遮蔽后的图像和密集预测为输入,并通过填补缺失的结构信息来重建原始图像。在编辑遮蔽后的图像中,边界等结构属性被破坏,而语义上下文大体保留。为使再生可行,条件生成器将需要从另一输入源(即密集预测)获取结构信息。因此,通过在训练中纳入该条件再生目标,DejaVu 鼓励基础网络学习在其密集预测中嵌入准确的场景结构。这带来了更清晰的边界和更好的空间一致性,从而预测更准确。当可利用额外计算时,DejaVu 可扩展为在密集预测网络内引入基于注意力的再生模块,进一步提升精度。通过在 Cityscapes、COCO、ADE20K、NYUD-v2 和 KITTI 等多个密集预测基准上的大量实验,我们证明了训练时使用 DejaVu 的有效性,因其在不增加计算成本的情况下优于 SOTA 方法。

关键词

引用

@article{arxiv.2303.01573,
  title  = {DejaVu: Conditional Regenerative Learning to Enhance Dense Prediction},
  author = {Shubhankar Borse and Debasmit Das and Hyojin Park and Hong Cai and Risheek Garrepalli and Fatih Porikli},
  journal= {arXiv preprint arXiv:2303.01573},
  year   = {2023}
}

备注

Accepted to CVPR 2023