Depth AnyEvent:面向事件相机单目深度估计的跨模态蒸馏范式
计算机视觉与模式识别
2025-09-19 v1
摘要
事件相机捕获稀疏、高时间分辨率的视觉信息,使其特别适合具有高速运动和强烈光照变化的挑战性环境。然而,缺乏具有密集真值深度标注的大规模数据集,阻碍了基于学习的事件数据单目深度估计。为解决这一限制,我们提出了一种跨模态蒸馏范式,利用视觉基础模型(VFM)生成密集代理标签。我们的策略需要与 RGB 帧空间对齐的事件流,这是一个简单的设置,即使开箱即用也能实现,并且利用了大规模 VFM 的鲁棒性。此外,我们提出适配 VFM,可以是像 Depth Anything v2(DAv2)这样的原生模型,也可以从中派生出一种新颖的循环架构,以从单目事件相机推断深度。我们在合成和真实世界数据集上评估了我们的方法,结果表明:(i) 我们的跨模态范式在不依赖昂贵深度标注的情况下取得了与全监督方法相当的性能,(ii) 我们的基于 VFM 的模型取得了最先进的性能。
引用
@article{arxiv.2509.15224,
title = {Depth AnyEvent: A Cross-Modal Distillation Paradigm for Event-Based Monocular Depth Estimation},
author = {Luca Bartolomei and Enrico Mannocci and Fabio Tosi and Matteo Poggi and Stefano Mattoccia},
journal= {arXiv preprint arXiv:2509.15224},
year = {2025}
}
备注
ICCV 2025. Code: https://github.com/bartn8/depthanyevent/ Project Page: https://bartn8.github.io/depthanyevent/