中文

用于深度估计的域不变特征自监督学习

计算机视觉与模式识别 2021-10-22 v4

摘要

我们解决了单图像深度估计中无监督合成到真实域适配问题。单图像深度估计的一个基本构建模块是以 RGB 图像为输入、输出深度图的任务编码器-解码器网络。本文中,我们提出一种新的训练策略,以自监督方式迫使任务网络学习域不变表示。具体而言,我们将传统作用于单域图像的自监督表示学习扩展至作用于双域图像的域不变表示学习,利用图像到图像翻译网络实现。首先,我们使用图像到图像翻译网络在合成域与真实域之间迁移域特定风格,该风格迁移操作使我们能获得来自不同域的相似图像。其次,我们用来自不同域的相同图像联合训练任务网络与孪生网络,使任务网络获得域不变性。最后,我们使用带标签的合成数据与无标签的真实世界数据微调任务网络。我们的训练策略在真实世界域中产生了改进的泛化能力。我们在 KITTI 和 Make3D 两个流行的深度估计数据集上进行了广泛评估,结果表明所提方法在所有指标上均优于 SOTA,例如在 KITTI 的 Sq Rel 上提升 14.7%。源代码与模型权重将公开提供。

关键词

引用

@article{arxiv.2106.02594,
  title  = {Self-Supervised Learning of Domain Invariant Features for Depth Estimation},
  author = {Hiroyasu Akada and Shariq Farooq Bhat and Ibraheem Alhashim and Peter Wonka},
  journal= {arXiv preprint arXiv:2106.02594},
  year   = {2021}
}

备注

14 pages: 8 main pages with supplementary materials, accepted to WACV2022