中文

LMDepth:面向真实世界部署的轻量级 Mamba 单目深度估计

计算机视觉与模式识别 2025-05-05 v1

摘要

单目深度估计为 RGB 图像提供了额外的深度维度,使其广泛应用于虚拟现实、自动驾驶和机器人导航等多个领域。然而,现有的深度估计算法往往难以有效平衡性能与计算效率,这给在资源受限设备上的部署带来了挑战。为解决这一问题,我们提出了 LMDepth,一种基于 Mamba 的轻量级单目深度估计网络,旨在以较低的计算开销重建高精度深度信息。具体而言,我们设计了一个改进的金字塔空间池化模块,作为多尺度特征聚合器和上下文提取器,确保获取全局空间信息以实现精确的深度估计。此外,我们在解码器中集成了多个深度 Mamba 模块。Mamba 模块基于线性计算设计,使 LMDepth 能够高效地从全局特征中解码深度信息,为依赖复杂注意力机制的 Transformer 架构提供了一种轻量级替代方案。在 NYUDv2 和 KITTI 数据集上的大量实验证明了我们提出的 LMDepth 的有效性。与以往的轻量级深度估计方法相比,LMDepth 以更少的参数量和更低的计算复杂度(以 GFLOPs 衡量)实现了更高的性能。我们进一步在嵌入式平台上部署了经 INT8 量化的 LMDepth,验证了其在真实世界边缘应用中的实用性。

关键词

引用

@article{arxiv.2505.00980,
  title  = {LMDepth: Lightweight Mamba-based Monocular Depth Estimation for Real-World Deployment},
  author = {Jiahuan Long and Xin Zhou},
  journal= {arXiv preprint arXiv:2505.00980},
  year   = {2025}
}