通过上下文感知时间注意力在动态环境中学习单目深度
计算机视觉与模式识别
2023-05-15 v1
摘要
单目深度估计任务近来展现出令人鼓舞的前景,尤其对于自动驾驶任务。为处理从 2D 单目图像进行 3D 几何推理的病态问题,多帧单目方法被开发出来以利用连续时间帧的视角关联信息。然而,汽车、火车等运动物体通常违背静态场景假设,导致特征不一致偏差与代价值错位,从而误导优化算法。在本工作中,我们提出 CTA-Depth,一种用于多帧单目深度估计的上下文感知时间注意力引导网络。具体而言,我们首先应用多级注意力增强模块整合多级图像特征,获得初始深度与位姿估计。随后采用所提出的 CTA-Refiner 交替优化深度与位姿。在优化过程中,我们开发了上下文感知时间注意力(CTA)以捕获全局时间-上下文关联,维持运动物体的特征一致性与估计完整性。特别地,我们提出长程几何嵌入(LGE)模块以生成长程时间几何先验。我们的方法在三个基准数据集上相比最先进方法取得了显著改进。
引用
@article{arxiv.2305.07397,
title = {Learning Monocular Depth in Dynamic Environment via Context-aware Temporal Attention},
author = {Zizhang Wu and Zhuozheng Li and Zhi-Gang Fan and Yunzhe Wu and Yuanzhu Gan and Jian Pu and Xianzhi Li},
journal= {arXiv preprint arXiv:2305.07397},
year = {2023}
}
备注
accepted by IJCAI 2023; 9 pages, 5 figures