中文

FSNet:面向自动驾驶全尺度深度预测的自监督单目深度重设计

计算机视觉与模式识别 2023-04-24 v1

摘要

利用单目图像预测准确深度对低成本机器人应用与自动驾驶十分重要。本研究提出一种综合自监督框架,利用惯性测量获得的帧间位姿,在自动驾驶场景上实现准确的尺度感知深度预测。具体地,我们引入名为 FSNet 的全尺度深度预测网络。相较现有自监督模型,FSNet 包含四项重要改进:(1)用于驾驶场景深度预测稳定训练的多通道输出表示,(2)为去除动态物体而设计的基于光流的掩码,(3)增强训练过程的自蒸馏训练策略,以及(4)测试时基于优化的后处理算法,融合来自视觉里程计的结果。借助该框架,仅配备一个良好标定相机的机器人与车辆可采集训练图像帧序列与相机位姿,并在无需额外标注工作或 3D 数据的情况下推断环境准确 3D 深度。在 KITTI 数据集、KITTI-360 数据集与 nuScenes 数据集上的大量实验展示了 FSNet 的潜力。更多可视化见 \url{https://sites.google.com/view/fsnet/home}

关键词

引用

@article{arxiv.2304.10719,
  title  = {FSNet: Redesign Self-Supervised MonoDepth for Full-Scale Depth Prediction for Autonomous Driving},
  author = {Yuxuan Liu and Zhenhua Xu and Huaiyang Huang and Lujia Wang and Ming Liu},
  journal= {arXiv preprint arXiv:2304.10719},
  year   = {2023}
}

备注

12 pages. conditionally accepted by IEEE T-ASE