Manydepth2: 动态场景中运动感知的自监督单目深度估计
计算机视觉与模式识别
2025-03-17 v9
摘要
尽管自监督单目深度估计取得了进展,但由于依赖于静态世界的假设,在动态场景中仍然存在挑战。在本文中,我们提出了Manydepth2,以实现对动态物体和静态背景的精确深度估计,同时保持计算效率。为了应对动态内容带来的挑战,我们结合光流和粗略单目深度来创建伪静态参考帧。然后利用该帧与原始目标帧协作构建运动感知代价体。此外,为了提高网络架构的准确性和鲁棒性,我们提出了一种基于注意力的深度网络,通过结合通道和非局部注意力机制,有效整合不同分辨率特征图的信息。与计算成本相似的方法相比,Manydepth2在KITTI-2015数据集上的自监督单目深度估计均方根误差显著降低了约5%。代码可在https://github.com/kaichen-z/Manydepth2获取。
引用
@article{arxiv.2312.15268,
title = {Manydepth2: Motion-Aware Self-Supervised Monocular Depth Estimation in Dynamic Scenes},
author = {Kaichen Zhou and Jia-Wang Bian and Jian-Qing Zheng and Jiaxing Zhong and Qian Xie and Niki Trigoni and Andrew Markham},
journal= {arXiv preprint arXiv:2312.15268},
year = {2025}
}
备注
Monocular Depth Estimation, Self-Supervised, Optical Flow