基于多尺度方向膨胀拉普拉斯和循环网络的鲁棒焦点法估计深度
计算机视觉与模式识别
2026-04-03 v1
摘要
焦点法(SFF)是一种被动深度估计技术,通过分析焦栈中焦点变化来推断场景深度。大多数最新的基于深度学习的SFF方法通常以两个阶段运行:首先,使用重型特征编码器提取焦点体(每个像素的焦点可能性在焦栈中的表示);然后,通过简单的单步骤聚合技术估计深度,常导致引入伪影并放大深度图中的噪声。为解决这些问题,我们提出了一种混合框架。该方法传统地使用手工制作的多尺度方向膨胀拉普拉斯(DDL)核提取焦点体,这些核捕获长程和方向性的焦点变化,以形成稳健的焦点体。然后,将这些焦点体输入轻量级、多尺度基于GRU的深度提取模块,以计算效率,迭代细化较低分辨率的初始深度估计。最后, our recurrent network 中的一个学习的凸 Upsampling 模块在保持细节和锐利边界的同时重建高分辨率深度图。在合成数据和真实世界数据集上的大量实验表明,我们的方法优于基于深度学习和传统方法的状态-of-the-art 方法,实现了在多样化焦点条件下的卓越精度和更好的泛化能力。
引用
@article{arxiv.2512.10498,
title = {Robust Shape from Focus via Multiscale Directional Dilated Laplacian and Recurrent Network},
author = {Khurram Ashfaq and Muhammad Tariq Mahmood},
journal= {arXiv preprint arXiv:2512.10498},
year = {2026}
}
备注
Accepted to IJCV