中文

改进的编码器-解码器架构用于精准的单目深度估计

计算机视觉与模式识别 2025-01-27 v5 图像与视频处理

摘要

从单张 2D 图像估计深度是一个具有挑战性的任务,因为缺乏立体或多视角数据,通常需要这些数据来进行深度感知。在最新架构中,主要挑战在于高效地捕获复杂对象和细粒度细节,这些细节往往难以预测。本文引入了一种基于深度学习的新方法,使用改进的编码器-解码器架构,其中 Inception-ResNet-v2 模型作为编码器。这首次将 Inception-ResNet-v2 用于单目深度估计,显示出优于先前模型的性能。它包含多尺度特征提取,以增强各种对象大小和距离上的深度预测准确性。我们提出了由深度损失、梯度边缘损失和结构相似性指数测度 (SSIM) 损失组成的复合损失函数,并对权重进行微调以优化加权求和,确保在深度估计的不同方面之间保持平衡。在 KITTI 数据集上的实验结果表明,我们的模型实现了显著更快的推理时间为 0.019 秒,在效率上优于视觉变换器,同时保持良好的准确性。在 NYU Depth V2 数据集上,该模型建立了最新的性能,绝对相对误差 (ARE) 为 0.064,均方根误差 (RMSE) 为 0.228,以及 δ<1.25\delta < 1.25 的准确率为 89.3%。这些指标表明,该模型能够在具有挑战性的场景中准确且高效地预测深度,为实际应用中的实时应用提供了实用解决方案。

关键词

引用

@article{arxiv.2410.11610,
  title  = {Enhanced Encoder-Decoder Architecture for Accurate Monocular Depth Estimation},
  author = {Dabbrata Das and Argho Deb Das and Farhan Sadaf},
  journal= {arXiv preprint arXiv:2410.11610},
  year   = {2025}
}