中文

基于事件焦点栈的单目焦点深度学习

计算机视觉与模式识别 2024-05-14 v1

摘要

从焦点估计深度的方法通过确定多个不同焦距拍摄的图像中最大焦点时的时刻(即焦点栈)来估计深度。然而,传统光学相机的有限采样率使得在焦点扫描期间难以获得足够的焦点线索。受生物视觉启发,事件相机以极低延迟记录强度变化,为焦点获取提供了更多的时间信息。本研究提出了 EDFF 网络,用于从事件焦点栈估计稀疏深度。具体而言,我们利用事件体素网格对强度变化信息进行编码,并将事件时间曲面投射到深度域以保留每个像素的焦距信息。我们提出了基于 Focal-Distance 的跨模态注意力模块,用于融合上述信息。此外,我们设计了多级深度融合模块,用于整合 UNet 类架构各层的结果并生成最终输出。大量实验验证了我们的方法在现有基于状态的方法方面具有优势。

关键词

引用

@article{arxiv.2405.06944,
  title  = {Learning Monocular Depth from Focus with Event Focal Stack},
  author = {Chenxu Jiang and Mingyuan Lin and Chi Zhang and Zhenghai Wang and Lei Yu},
  journal= {arXiv preprint arXiv:2405.06944},
  year   = {2024}
}