中文

基于校准反投影层的无监督深度补全

计算机视觉与模式识别 2021-10-12 v2 人工智能 机器学习

摘要

我们提出了一种深度神经网络架构,用于从单张图像和稀疏点云推断稠密深度。该网络使用视频流和对应的同步稀疏点云(如从激光雷达或其他距离传感器获取)以及相机的内参校准参数进行训练。在推理时,相机的校准参数(可能与训练时使用的不同)与稀疏点云和单张图像一起作为输入馈入网络。校准反投影层利用校准矩阵和深度特征描述符将图像中的每个像素反投影到三维空间。生成的三维位置编码与图像描述符及前一层输出拼接,作为编码器下一层的输入。解码器利用跳跃连接生成稠密深度图。由此产生的校准反投影网络(KBNet)通过最小化光度重投影误差进行无监督训练。KBNet基于训练集而非通用正则化来填补缺失的深度值。我们在公开的深度补全基准上测试了KBNet,当使用相同相机进行训练和测试时,其性能在室内和室外场景分别优于现有技术30.5%和8.8%。当测试相机不同时,提升幅度达到62%。代码见:https://github.com/alexklwong/calibrated-backprojection-network。

关键词

引用

@article{arxiv.2108.10531,
  title  = {Unsupervised Depth Completion with Calibrated Backprojection Layers},
  author = {Alex Wong and Stefano Soatto},
  journal= {arXiv preprint arXiv:2108.10531},
  year   = {2021}
}