$D^3$-RSMDE:40倍加速的高保真遥感单目深度估计
计算机视觉与模式识别
2026-03-18 v1 人工智能
摘要
实时、高保真的遥感图像单目深度估计对于诸多应用至关重要,但现有方法在精度与效率之间面临明显的权衡。虽然使用基于 Vision Transformer (ViT) 的网络进行密集预测速度快,但常表现出差异的感知质量。相反,扩散模型虽然提供高保真度,但计算成本极高。为克服这些限制,我们提出 Depth Detail Diffusion for Remote Sensing Monocular Depth Estimation (-RSMDE),一个旨在实现速度与质量最佳平衡的高效框架。我们的框架首先利用基于 ViT 的模块快速生成高质量的深度图初稿,作为结构先验,有效取代扩散模型中耗时的初始结构生成阶段。基于该先验,我们提出了渐进式线性混合细节 refinement (PLBR) 策略,该策略仅需少数迭代即可利用轻量级 U-Net 对细节进行细化。整个 refinement 步骤在由变分自编码器 (VAE) 支持的紧凑潜在空间中高效运行。大量实验表明,-RSMDE 在 LPIPS 感知指标上比 Marigold 等领先模型实现了约 11.85% 的显著性降低,同时实现了推理速度提升超过 40 倍,VRAM 使用保持对轻量级 ViT 模型的可比。
引用
@article{arxiv.2603.16362,
title = {$D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation},
author = {Ruizhi Wang and Weihan Li and Zunlei Feng and Haofei Zhang and Mingli Song and Jiayu Wang and Jie Song and Li Sun},
journal= {arXiv preprint arXiv:2603.16362},
year = {2026}
}