基于循环Transformer的事件相机单目稠密深度估计
计算机视觉与模式识别
2022-12-07 v1
摘要
事件相机凭借高时间分辨率与高动态范围,为解决单目深度估计中的常见挑战(如运动模糊与低光照)提供了新视角。然而,如何有效利用异步事件中稀疏的空间信息与丰富的时序线索仍是一项艰巨任务。为此,我们提出了一种基于事件、带有循环Transformer的新型单目深度估计器,即EReFormer,它是首个具有递归机制以处理连续事件流的纯Transformer。在技术层面,对于空间建模,提出了一种带有空间Transformer融合模块的基于Transformer的编码器-解码器,其比基于CNN的方法具有更好的全局上下文信息建模能力。对于时序建模,我们设计了一种门控循环视觉Transformer单元,将递归机制引入Transformer,在提升时序建模能力的同时缓解高昂的GPU显存开销。实验结果表明,我们的EReFormer在合成与真实数据集上均以一定优势优于SOTA方法。我们希望本工作能吸引更多研究来开发事件视觉领域中出色的Transformer。我们的开源代码见补充材料。
引用
@article{arxiv.2212.02791,
title = {Event-based Monocular Dense Depth Estimation with Recurrent Transformers},
author = {Xu Liu and Jianing Li and Xiaopeng Fan and Yonghong Tian},
journal= {arXiv preprint arXiv:2212.02791},
year = {2022}
}
备注
10 pages, 5 figures