MAMo:利用记忆与注意力进行单目视频深度估计
计算机视觉与模式识别
2025-01-17 v3
摘要
我们提出MAMo,一种用于单目视频深度估计的新型记忆与注意力框架。MAMo可将任意单图像深度估计网络增强并改进为视频深度估计模型,使其利用时间信息预测更准确的深度。在MAMo中,我们为模型增添记忆,在模型流式处理视频时辅助深度预测。具体而言,记忆存储先前时刻学到的视觉与位移令牌。这使得深度网络在预测当前帧深度时可交叉参考过去的相关特征。我们引入一种持续更新记忆的新方案,优化其保留与过去和当前视觉信息均对应的令牌。我们采用基于注意力的方法处理记忆特征:首先使用自注意力模块学习所得视觉与位移记忆令牌间的时空关系;随后通过交叉注意力将自注意力输出特征与当前视觉特征聚合;最终将交叉注意力特征送入解码器以预测当前帧深度。通过在KITTI、NYU-Depth V2和DDAD等多个基准上的大量实验,我们表明MAMo持续改良单目深度估计网络并刷新最先进(SOTA)精度。值得注意的是,与SOTA基于代价体积(cost-volume)的视频深度模型相比,我们的MAMo视频深度估计以更低延迟提供了更高精度。
引用
@article{arxiv.2307.14336,
title = {MAMo: Leveraging Memory and Attention for Monocular Video Depth Estimation},
author = {Rajeev Yasarla and Hong Cai and Jisoo Jeong and Yunxiao Shi and Risheek Garrepalli and Fatih Porikli},
journal= {arXiv preprint arXiv:2307.14336},
year = {2025}
}
备注
Accepted at ICCV 2023