中文

基于频率选择性融合的一致直接TOF视频深度完成——SVDC

计算机视觉与模式识别 2025-03-04 v1

摘要

轻量级直接时间-of-flight (dToF) 传感器适合用于移动设备的3D感知。然而,由于紧凑设备的制造限制以及成像的固有物理原理,dToF 深度图稀疏且噪声较大。本文提出了一种新颖的视频深度完成方法,称为SVDC,通过融合稀疏dToF数据与相应的RGB指导实现。我们的方法采用多帧融合方案以缓解稀疏dToF成像导致的空间歧义。多帧融合期间的连续帧错位可能导致物体边缘与背景混合,结果导致细节丢失。为解决这一问题,我们引入了自适应频率选择性融合 (Adaptive Frequency Selective Fusion, AFSF) 模块,该模块自动选择卷积核大小来融合多帧特征。我们的AFSF利用通道-空间增强注意力 (Channel-Spatial Enhancement Attention, CSEA) 模块增强特征并生成注意力图作为融合权重。AFSF 在恢复边缘细节的同时抑制平滑区域的高频噪声。为进一步增强时序一致性,我们提出了一种跨窗口一致性损失,以确保不同窗口中的预测一致,从而有效减少闪烁。我们提出的SVDC在TartanAir 和 Dynamic Replica 数据集上实现了最佳精度和一致性。代码已在 https://github.com/Lan1eve/SVDC 上提供。

关键词

引用

@article{arxiv.2503.01257,
  title  = {SVDC: Consistent Direct Time-of-Flight Video Depth Completion with Frequency Selective Fusion},
  author = {Xuan Zhu and Jijun Xiang and Xianqi Wang and Longliang Liu and Yu Wang and Hong Zhang and Fei Guo and Xin Yang},
  journal= {arXiv preprint arXiv:2503.01257},
  year   = {2025}
}

备注

Accepted by CVPR 2025