基于频率选择性融合的一致直接TOF视频深度完成——SVDC
计算机视觉与模式识别
2025-03-04 v1
摘要
轻量级直接时间-of-flight (dToF) 传感器适合用于移动设备的3D感知。然而,由于紧凑设备的制造限制以及成像的固有物理原理,dToF 深度图稀疏且噪声较大。本文提出了一种新颖的视频深度完成方法,称为SVDC,通过融合稀疏dToF数据与相应的RGB指导实现。我们的方法采用多帧融合方案以缓解稀疏dToF成像导致的空间歧义。多帧融合期间的连续帧错位可能导致物体边缘与背景混合,结果导致细节丢失。为解决这一问题,我们引入了自适应频率选择性融合 (Adaptive Frequency Selective Fusion, AFSF) 模块,该模块自动选择卷积核大小来融合多帧特征。我们的AFSF利用通道-空间增强注意力 (Channel-Spatial Enhancement Attention, CSEA) 模块增强特征并生成注意力图作为融合权重。AFSF 在恢复边缘细节的同时抑制平滑区域的高频噪声。为进一步增强时序一致性,我们提出了一种跨窗口一致性损失,以确保不同窗口中的预测一致,从而有效减少闪烁。我们提出的SVDC在TartanAir 和 Dynamic Replica 数据集上实现了最佳精度和一致性。代码已在 https://github.com/Lan1eve/SVDC 上提供。
关键词
引用
@article{arxiv.2503.01257,
title = {SVDC: Consistent Direct Time-of-Flight Video Depth Completion with Frequency Selective Fusion},
author = {Xuan Zhu and Jijun Xiang and Xianqi Wang and Longliang Liu and Yu Wang and Hong Zhang and Fei Guo and Xin Yang},
journal= {arXiv preprint arXiv:2503.01257},
year = {2025}
}
备注
Accepted by CVPR 2025