GSDC Transformer:一种用于单目多帧深度估计的高效有效线索融合方法
计算机视觉与模式识别
2023-12-06 v2
摘要
深度估计为自动驾驶中感知三维信息提供了替代途径。单目深度估计无论采用单帧还是多帧输入,均已通过学习的各类线索并在静态或动态场景中专精而取得显著成功。近来,这些线索的融合成为引人关注的话题,旨在使组合线索在两类场景中均表现良好。然而,自适应线索融合依赖注意力机制,其二次复杂度限制了线索表示的粒度。此外,显式线索融合依赖精确分割,给掩码预测带来沉重负担。为解决这些问题,我们提出 GSDC Transformer,一种用于单目多帧深度估计中线索融合的高效且有效组件。我们利用可变形注意力在精细尺度上学习线索关系,而稀疏注意力在粒度增加时降低计算需求。为弥补动态场景中精度下降,我们以超令牌形式表示场景属性而不依赖精确形状。在每个归属于动态场景的超令牌内,我们聚集其相关线索并学习局部稠密关系以增强线索融合。我们的方法在 KITTI 数据集上以高效融合速度取得了最先进性能。
引用
@article{arxiv.2309.17059,
title = {GSDC Transformer: An Efficient and Effective Cue Fusion for Monocular Multi-Frame Depth Estimation},
author = {Naiyu Fang and Lemiao Qiu and Shuyou Zhang and Zili Wang and Zheyuan Zhou and Kerui Hu},
journal= {arXiv preprint arXiv:2309.17059},
year = {2023}
}