EventVGGT:探索跨模态蒸馏用于基于事件的深度估计
计算机视觉与模式识别
2026-03-11 v1
摘要
事件相机对高速运动和极端光照条件的灵敏度更高,使得基于事件的单目深度估计成为在恶劣条件下稳健的3D感知的有前景的方法。然而,由于稀缺的密集深度标注,进展受到严重制约。虽然最近的无标注方法通过从视觉基础模型 (VFM) 蒸馏知识来缓解这一问题,但仍存在关键局限:这些方法将事件流处理为独立帧。在忽略事件数据固有时序连续性方面,这些方法无法利用 VFM 中编码的丰富时序先验,最终导致时序不一致且深度预测不够准确。为此,我们提出 EventVGGT,一种显式将事件序列建模为连贯视频序列的新框架。据我们所知,我们是首次将视觉几何 grounding transformer (VGGT) 中的时空和多视几何先验蒸馏到事件域。我们通过一个全面的三级蒸馏策略实现:(i) 跨模态特征混合 (CMFM) 在输出层通过融合 RGB 和事件特征生成辅助深度预测;(ii) 时空特征蒸馏 (STFD) 在特征层蒸馏 VGGT 的强大时空表征;(iii) 时序一致性蒸馏 (TCD) 在时序层通过对齐帧间深度变化实现跨帧一致性。大量实验表明,EventVGGT 在所有现有方法上均表现出色——在 EventScape 上将绝对均值深度误差降低超过53%(从2.30降至1.06)——同时在未见的 DENSE 和 MVSEC 数据集上表现出稳健的零样本泛化能力。
引用
@article{arxiv.2603.09385,
title = {EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation},
author = {Yinrui Ren and Jinjing Zhu and Kanghao Chen and Zhuoxiao Li and Jing Ou and Zidong Cao and Tongyan Hua and Peilun Shi and Yingchun Fu and Wufan Zhao and Hui Xiong},
journal= {arXiv preprint arXiv:2603.09385},
year = {2026}
}