中文

基于全局与局域自适应膨胀“T 形”卷积的 Deep 3D Pan

信号处理 2019-10-22 v3 计算机视觉与模式识别 图像与视频处理

摘要

深度学习的近期进展在许多底层视觉任务中显示出有前景的结果。然而,解决基于单图像的视图合成仍是一个开放问题。特别地,给定单张输入图像生成平行相机视角下的新图像极具意义,因为它实现了对 2D 输入景物的 3D 可视化。我们提出一种新颖的网络架构,以在沿 X 轴的任意相机位置执行立体视图合成,即 Deep 3D Pan,其配备具有全局与局域自适应膨胀的“T 形”自适应核。我们提出的网络架构 monster-net 设计有一种新颖的带全局与局域自适应膨胀的“T 形”自适应核,当给定 2D 输入图像时,它能高效地将全局相机位移纳入并处理的局部 3D 几何,以合成自然观感的 3D 平移视图。我们在 KITTI、CityScapes 以及我们的 VICLAB_STEREO 室内数据集上进行了大量实验以证明方法的有效性。我们的 monster-net 在所有 RMSE、PSNR 和 SSIM 指标上以较大优势显著优于当前最优方法 SOTA。我们提出的 monster-net 能够在合成图像中重建具有一致几何的更可靠图像结构。此外,可从“T 形”核提取的视差信息比 SOTA 在无监督单目深度估计任务中的视差信息可靠得多,证实了方法的有效性。

关键词

引用

@article{arxiv.1910.01089,
  title  = {Deep 3D Pan via adaptive "t-shaped" convolutions with global and local adaptive dilations},
  author = {Juan Luis Gonzalez Bello and Munchurl Kim},
  journal= {arXiv preprint arXiv:1910.01089},
  year   = {2019}
}

备注

Check our video at https://www.youtube.com/watch?v=o0b-e282Rt4