实时语义立体匹配
计算机视觉与模式识别
2020-02-26 v2 机器人学
摘要
场景理解在机器人、自主导航、增强现实以及许多其他领域中至关重要。为充分完成此任务,自主智能体必须推断所感知场景的 3D 结构(以知晓其观测位置)及其内容(以知晓其看到什么)。为应对这两项任务,训练用于从立体图像推断语义分割与深度的深度神经网络通常是首选。具体而言,语义立体匹配可通过为两项任务独立训练的独立模型或联合端到端架构来解决。然而,正如目前所提出的,两种方案均效率低下:前者需要两次前向传播,后者因单一网络复杂性而低效,尽管联合处理两项任务通常在精度上更有利。本文中,我们提出一种用于实时语义立体匹配的紧凑轻量型单一架构。我们的框架依赖于多阶段由粗到精的估计,可实现:i)即使在嵌入式设备上也能非常快速地推理,与 SOTA 网络相比精度下降甚微;ii)根据具体应用需求在精度与速度间权衡。在高性能 GPU 及嵌入式 Jetson TX2 上的实验结果证实了语义立体匹配相较独立任务的优越性,并凸显了我们框架在任何硬件及任何应用上的通用性。
引用
@article{arxiv.1910.00541,
title = {Real-Time Semantic Stereo Matching},
author = {Pier Luigi Dovesi and Matteo Poggi and Lorenzo Andraghetti and Miquel Martí and Hedvig Kjellström and Alessandro Pieropan and Stefano Mattoccia},
journal= {arXiv preprint arXiv:1910.00541},
year = {2020}
}
备注
8 pages, 3 figures. Accepted to ICRA 2020