相机高度不变:度量级单目道路场景深度估计的无监督训练
计算机视觉与模式识别
2024-10-02 v3 机器人学
摘要
本文提出了一种新颖的训练方法,使任何单目深度网络仅从常规训练数据(即驾驶视频)中学习绝对尺度并估计度量级道路场景深度。我们将此训练框架称为 FUMET。其核心思想是利用道路上发现的汽车作为尺度监督的来源,并将其稳健地融入网络训练。FUMET 检测并估计帧中汽车的尺寸,将从它们提取的尺度信息聚合为相机高度的估计值,并将该高度在整个视频序列中的一致性作为尺度监督来强制执行。这实现了对任何原本尺度无关的单目深度网络进行鲁棒的无监督训练,使其不仅具有尺度感知能力,而且具有度量精度,无需辅助传感器和额外监督。在 KITTI 和 Cityscapes 数据集上的大量实验表明了 FUMET 的有效性,其达到了最先进的精度。我们还表明,FUMET 支持在不同相机高度的混合数据集上进行训练,从而实现更大规模的训练和更好的泛化能力。度量级深度重建在任何道路场景视觉建模中都至关重要,而 FUMET 通过建立将任何模型转换为度量深度估计器的方法,使其部署变得大众化。
引用
@article{arxiv.2312.04530,
title = {Camera Height Doesn't Change: Unsupervised Training for Metric Monocular Road-Scene Depth Estimation},
author = {Genki Kinoshita and Ko Nishino},
journal= {arXiv preprint arXiv:2312.04530},
year = {2024}
}
备注
ECCV 2024. Project page: https://vision.ist.i.kyoto-u.ac.jp/research/fumet/