FocDepthFormer:融合潜变量 LSTM 的 Transformer 用于聚焦堆栈深度估计
计算机视觉与模式识别
2024-12-05 v3 人工智能
图像与视频处理
摘要
大多数现有的从图像聚焦堆栈进行深度估计的方法采用卷积神经网络(CNN),在固定图像集上使用 2D 或 3D 卷积。然而,其有效性受限于 CNN 核的局部特性,使其在训练与推理时仅能处理固定数量图像的聚焦堆栈。该限制妨碍了其对任意长度堆栈的泛化能力。为克服这些局限,我们提出一种新颖的基于 Transformer 的网络 FocDepthFormer,其将 Transformer 与 LSTM 模块及 CNN 解码器相集成。Transformer 的自注意力机制通过隐式执行非局部交叉参照,学习更具信息量的空间特征。LSTM 模块旨在跨不同长度的图像堆栈整合表示。此外,我们在早期编码器中采用多尺度卷积核以捕获不同聚焦/散焦程度下的低级特征。通过引入 LSTM,FocDepthFormer 可在大规模单目 RGB 深度估计数据集上预训练,从而改进视觉模式学习并减少对难以获取的聚焦堆栈数据的依赖。在多种聚焦堆栈基准数据集上的大量实验表明,我们的模型在多个评价指标上优于当前最优方法。
引用
@article{arxiv.2310.11178,
title = {FocDepthFormer: Transformer with latent LSTM for Depth Estimation from Focal Stack},
author = {Xueyang Kang and Fengze Han and Abdur R. Fayjie and Patrick Vandewalle and Kourosh Khoshelham and Dong Gong},
journal= {arXiv preprint arXiv:2310.11178},
year = {2024}
}
备注
30 pages, 20 figures, Conference paper