面向目标检测的混合脉冲视觉 Transformer
计算机视觉与模式识别
2025-05-13 v1 人工智能
摘要
基于事件的对象检测因其高时序分辨率、宽动态范围和异步地址事件表示等优势而受到越来越多的关注。利用这些优势,脉冲神经网络 (Spiking Neural Networks, SNNs) 作为一种有前景的 Method,能够实现低能耗和丰富的时空动力学。为进一步提升事件检测性能,本研究提出一种新型混合脉冲视觉 Transformer (HsVT) 模型。HsVT 模型集成了空间特征提取模块以捕获局部和全局特征,以及时序特征提取模块以建模事件序列中的时间依赖性和长期模式。这种组合使 HsVT 能够捕获时空特征,提高处理复杂事件检测任务的能力。为支持该领域的研究,我们开发并公开了 The Fall Detection Dataset 作为事件检测任务的基准数据集。该数据集使用基于事件的相机捕获,确保面部隐私保护,并因事件表示格式而降低内存使用。我们在 GEN1 和 Fall Detection 数据集上评估了不同规模的 HsVT 模型。实验结果表明,HsVT 在参数更少的情况下实现了显著的检测性能提升。
引用
@article{arxiv.2505.07715,
title = {Hybrid Spiking Vision Transformer for Object Detection with Event Cameras},
author = {Qi Xu and Jie Deng and Jiangrong Shen and Biwu Chen and Huajin Tang and Gang Pan},
journal= {arXiv preprint arXiv:2505.07715},
year = {2025}
}