中文

面向目标检测的混合脉冲视觉 Transformer

计算机视觉与模式识别 2025-05-13 v1 人工智能

摘要

基于事件的对象检测因其高时序分辨率、宽动态范围和异步地址事件表示等优势而受到越来越多的关注。利用这些优势,脉冲神经网络 (Spiking Neural Networks, SNNs) 作为一种有前景的 Method,能够实现低能耗和丰富的时空动力学。为进一步提升事件检测性能,本研究提出一种新型混合脉冲视觉 Transformer (HsVT) 模型。HsVT 模型集成了空间特征提取模块以捕获局部和全局特征,以及时序特征提取模块以建模事件序列中的时间依赖性和长期模式。这种组合使 HsVT 能够捕获时空特征,提高处理复杂事件检测任务的能力。为支持该领域的研究,我们开发并公开了 The Fall Detection Dataset 作为事件检测任务的基准数据集。该数据集使用基于事件的相机捕获,确保面部隐私保护,并因事件表示格式而降低内存使用。我们在 GEN1 和 Fall Detection 数据集上评估了不同规模的 HsVT 模型。实验结果表明,HsVT 在参数更少的情况下实现了显著的检测性能提升。

关键词

引用

@article{arxiv.2505.07715,
  title  = {Hybrid Spiking Vision Transformer for Object Detection with Event Cameras},
  author = {Qi Xu and Jie Deng and Jiangrong Shen and Biwu Chen and Huajin Tang and Gang Pan},
  journal= {arXiv preprint arXiv:2505.07715},
  year   = {2025}
}