面向全景全景单目深度估计的尺度感知 Transformer 方法
计算机视觉与模式识别
2024-07-16 v1
摘要
全景单目深度(FSM)方法可从多个摄像头视角以自监督方式学习,以预测尺度感知深度,这在实际应用中比单一单目摄像头的尺度模糊深度更为实用。本文致力于增强FSM方法的尺度感知能力进行深度估计。为此,我们从两个角度改进FSM:深度网络结构优化和训练管线优化。首先,我们构建了一个基于Transformer的深度网络,采用邻域增强跨视图注意力(NCA)。跨注意力模块能够在全局和邻近视角中更好地聚合跨视图上下文。其次,我们构建了一个基于Transformer的特征匹配方案,采用渐进式训练来改进结构-from-motion(SfM)管线。这使我们能够获得足够的匹配点,从而实现尺度感知学习,并通过基于SfM损失去除不匹配项来促进网络收敛。实验表明,所提出的尺度感知全景单目深度(SA-FSM)方法在测试时无需中位数缩放即可大幅提高尺度感知深度预测精度,在DDAD基准上较SurroundDepth等最新FSM方法表现更佳,在delta<1.25的准确度上提升了3.8%。
关键词
引用
@article{arxiv.2407.10406,
title = {Towards Scale-Aware Full Surround Monodepth with Transformers},
author = {Yuchen Yang and Xinyi Wang and Dong Li and Lu Tian and Ashish Sirasao and Xun Yang},
journal= {arXiv preprint arXiv:2407.10406},
year = {2024}
}