中文

SQLdepth:可泛化的自监督细结构单目深度估计

计算机视觉与模式识别 2023-09-04 v1

摘要

近来,自监督单目深度估计因在自动驾驶与机器人中的众多应用而受到欢迎。然而,现有方案主要从即时视觉特征估计深度,难以恢复细粒度场景细节且泛化能力有限。本文中,我们提出 SQLdepth,一种能从运动中有效学习细粒度场景结构的新型方法。在 SQLdepth 中,我们提出一种新颖的自查询层(Self Query Layer, SQL)来构建自代价体并从中推断深度,而非从特征图推断深度。该自代价体在单帧内隐式捕获场景的内在几何。代价体的每个单独切片表示潜在空间中点与物体间的相对距离。最终,该体通过一种新颖解码方法压缩为深度图。在 KITTI 与 Cityscapes 上的实验结果表明,我们的方法取得了卓越的 SOTA 性能(KITTI 上 AbsRel = 0.0820.082,改进真值下 KITTI 上 0.0520.052,Cityscapes 上 0.1060.106),相较先前最佳分别实现 9.9%9.9\%5.5%5.5\%4.5%4.5\% 的误差降低。此外,我们的方法展现出更低的训练复杂度、计算效率、改进的泛化能力以及恢复细粒度场景细节的能力。而且,自监督预训练且度量微调的 SQLdepth 可大幅超越现有监督方法(AbsRel = 0.0430.043,误差降低 14%14\%)。SQL 中面向自匹配的相对距离查询提升了 SQLdepth 的鲁棒性与零样本泛化能力。代码与预训练权重将公开可用。代码见 \href{https://github.com/hisfog/SQLdepth-Impl}{https://github.com/hisfog/SQLdepth-Impl}。

关键词

引用

@article{arxiv.2309.00526,
  title  = {SQLdepth: Generalizable Self-Supervised Fine-Structured Monocular Depth Estimation},
  author = {Youhong Wang and Yunji Liang and Hao Xu and Shaohui Jiao and Hongkai Yu},
  journal= {arXiv preprint arXiv:2309.00526},
  year   = {2023}
}

备注

14 pages, 9 figures