中文

利用全局感知与几何平滑性基于车载视频的自监督深度估计

计算机视觉与模式识别 2021-06-08 v1

摘要

自监督深度估计因无需标注数据而仅需图像序列,近年来备受关注。此外,它可便捷地用于自动驾驶、机器人、实景导航与智慧城市等多种应用。然而,从图像中提取全局上下文信息并预测几何自然的深度图仍具挑战。本文提出 DLNet 用于逐像素深度估计,其借助我们所提深度 Linformer 模块同时提取全局与局部特征。该模块由 Linformer 与创新软分割多层感知机块组成。此外,提出三维几何平滑损失,通过对预测的三维点云施加二阶平滑约束来预测几何自然的深度图,从而作为副产品实现性能提升。最后,我们探索多尺度预测策略,并提出最大间隔双尺度预测策略以进一步提升性能。在 KITTI 与 Make3D 基准上的实验中,所提 DLNet 取得了与最先进方法相竞争的性能,将时间与空间复杂度分别降低逾 62%62\%56%56\%。在多种真实场景下的广泛测试进一步证明了所提模型的强实用性与泛化能力。

关键词

引用

@article{arxiv.2106.03505,
  title  = {Self-supervised Depth Estimation Leveraging Global Perception and Geometric Smoothness Using On-board Videos},
  author = {Shaocheng Jia and Xin Pei and Wei Yao and S. C. Wong},
  journal= {arXiv preprint arXiv:2106.03505},
  year   = {2021}
}