改进的编码器-解码器架构用于精准的单目深度估计
计算机视觉与模式识别
2025-01-27 v5 图像与视频处理
摘要
从单张 2D 图像估计深度是一个具有挑战性的任务,因为缺乏立体或多视角数据,通常需要这些数据来进行深度感知。在最新架构中,主要挑战在于高效地捕获复杂对象和细粒度细节,这些细节往往难以预测。本文引入了一种基于深度学习的新方法,使用改进的编码器-解码器架构,其中 Inception-ResNet-v2 模型作为编码器。这首次将 Inception-ResNet-v2 用于单目深度估计,显示出优于先前模型的性能。它包含多尺度特征提取,以增强各种对象大小和距离上的深度预测准确性。我们提出了由深度损失、梯度边缘损失和结构相似性指数测度 (SSIM) 损失组成的复合损失函数,并对权重进行微调以优化加权求和,确保在深度估计的不同方面之间保持平衡。在 KITTI 数据集上的实验结果表明,我们的模型实现了显著更快的推理时间为 0.019 秒,在效率上优于视觉变换器,同时保持良好的准确性。在 NYU Depth V2 数据集上,该模型建立了最新的性能,绝对相对误差 (ARE) 为 0.064,均方根误差 (RMSE) 为 0.228,以及 的准确率为 89.3%。这些指标表明,该模型能够在具有挑战性的场景中准确且高效地预测深度,为实际应用中的实时应用提供了实用解决方案。
引用
@article{arxiv.2410.11610,
title = {Enhanced Encoder-Decoder Architecture for Accurate Monocular Depth Estimation},
author = {Dabbrata Das and Argho Deb Das and Farhan Sadaf},
journal= {arXiv preprint arXiv:2410.11610},
year = {2025}
}