PLADE-Net:基于神经位置编码与蒸馏抠图损失实现自监督单目深度估计的像素级精度
计算机视觉与模式识别
2021-03-15 v1
摘要
本文提出一种自监督单视图像素级精确深度估计网络,称为 PLADE-Net。PLADE-Net 是首个在具挑战性的 KITTI 数据集上以 指标达到超过 95\% 前所未有精度水平的工作。我们的 PLADE-Net 基于一种带有神经位置编码的新网络架构,以及一种从抠图拉普拉斯闭式解借鉴、从立体图像学习像素级精确深度估计的新损失函数。神经位置编码通过让网络推理镜头与投影畸变等位置相关图像属性,使 PLADE-Net 获得更一致的深度估计。我们新颖的蒸馏抠图拉普拉斯损失使网络能在物体边界预测锐利深度,并在高度同质区域预测更一致深度。所提方法在具挑战性的 KITTI 数据集上大幅优于以往所有自监督单视图深度估计方法,达到前所未有的精度水平。此外,我们的 PLADE-Net 朴素扩展至立体输入后,即使无任何如 1D 相关、3D 卷积或空间金字塔池化等高级模块,也优于近期自监督立体方法。我们给出了支持方法在 KITTI、CityScapes 和 Make3D 数据集上有效性的广泛消融研究与实验。
引用
@article{arxiv.2103.07362,
title = {PLADE-Net: Towards Pixel-Level Accuracy for Self-Supervised Single-View Depth Estimation with Neural Positional Encoding and Distilled Matting Loss},
author = {Juan Luis Gonzalez Bello and Munchurl Kim},
journal= {arXiv preprint arXiv:2103.07362},
year = {2021}
}
备注
Accepted paper (poster) at CVPR2021