RTS-Mono:面向实际部署的实时自监督单目深度估计方法
计算机视觉与模式识别
2025-11-19 v1
摘要
深度信息对自动驾驶和智能机器人导航至关重要。单目深度估计的简单性和灵活性使其在这些领域中占据重要位置。然而,大多数现有的单目深度估计模型消耗大量计算资源。尽管某些方法已降低模型大小并提高计算效率,但性能会恶化,严重阻碍了自监督单目深度估计模型在现实世界中实际部署。为此,我们提出了一个实时自监督单目深度估计方法并在实际世界中实现。其称为 RTS-Mono,这是一个轻量级且高效的编码器-解码器架构。编码器基于 Lite-Encoder 构建,解码器采用多尺度稀疏融合框架以最小化冗余、保证性能并提高推理速度。在 KITTI 数据集上的实验中,RTS-Mono 在高和低分辨率下均实现了最先进 (SoTA) 的性能,参数数量极低(仅 3 M)。与轻量级方法相比,RTS-Mono 在低分辨率下使 Abs Rel 和 Sq Rel 分别提高了 5.6% 和 9.8%,在高分辨率下使 Sq Rel 和 RMSE 分别提高了 6.1% 和 1.9%。在实际部署实验中,RTS-Mono 具有极高的准确性,可在 Nvidia Jetson Orin 上以 49 FPS 的速度实现实时推理。源代码已公开 https://github.com/ZYCheng777/RTS-Mono。
引用
@article{arxiv.2511.14107,
title = {RTS-Mono: A Real-Time Self-Supervised Monocular Depth Estimation Method for Real-World Deployment},
author = {Zeyu Cheng and Tongfei Liu and Tao Lei and Xiang Hua and Yi Zhang and Chengkai Tang},
journal= {arXiv preprint arXiv:2511.14107},
year = {2025}
}
备注
14 pages, 10 figures