中文

一种新颖的脉冲Transformer网络:通过跨模态知识蒸馏实现事件相机的深度估计

计算机视觉与模式识别 2025-02-25 v3 人工智能

摘要

深度估计是计算机视觉中的一项关键任务,应用于自主导航、机器人和增强现实。事件相机将光强度的时变编码为异步二进制脉冲,具有低延迟、高动态范围和能效等独特优势。然而,其非常规的脉冲输出和标记数据集的稀缺对传统的基于图像的深度估计方法构成了重大挑战。为了应对这些挑战,我们提出了一种新颖的节能脉冲驱动Transformer网络(SDT)用于深度估计,利用了脉冲数据的独特属性。所提出的SDT引入了三个关键创新:(1)纯脉冲驱动的Transformer架构,包含基于脉冲的注意力和残差机制,能够以最小的能耗实现精确的深度估计;(2)融合深度估计头,结合多阶段特征进行细粒度深度预测,同时确保计算效率;(3)跨模态知识蒸馏框架,利用预训练的视觉基础模型(DINOv2)在数据有限的情况下增强脉冲网络的训练。这项工作首次探索了基于Transformer的脉冲神经网络用于深度估计,为实际视觉应用中的节能神经形态计算迈出了重要一步。

关键词

引用

@article{arxiv.2404.17335,
  title  = {A Novel Spike Transformer Network for Depth Estimation from Event Cameras via Cross-modality Knowledge Distillation},
  author = {Xin Zhang and Liangxiu Han and Tam Sobeih and Lianghao Han and Darren Dancey},
  journal= {arXiv preprint arXiv:2404.17335},
  year   = {2025}
}

备注

16 pages