HDI-Former:用于帧和事件的混合动态交互 ANN-SNN Transformer 目标检测
计算机视觉与模式识别
2024-12-02 v1
摘要
将帧和事件的互补优势已被广泛用于挑战场景中的目标检测。然而,大多数目标检测方法使用两个独立的人工神经网络(ANN)分支,限制了两种视觉流之间的数据交互,并在低功耗条件下难以从事件流中提取时序线索。为了解决这些挑战,我们提出HDI-Former,即一种混合动态交互 ANN-SNN Transformer,标志着首次设计用于高精度和高效能目标检测的直接训练混合 ANN-SNN 架构。技术上,我们首先提出一种语义增强自注意力机制,以增强图像编码标记在ANN Transformer分支中的相关性,以获得更好的性能。然后,我们设计一种Spiking Swin Transformer分支以低功耗建模事件流中的时序线索。最后,我们提出一种受生物启发的动态交互机制,用于ANN和SNN子网络之间的跨模态信息交互。结果表明,HDI-Former在超过十一款最先进的方法和四个基线上的性能均显著优于。我们的SNN分支在DSEC-Detection数据集上,虽保持相同架构,却仅 consume 10.57 的能源,性能相当于ANN。我们的开源代码已包含在补充材料中。
关键词
引用
@article{arxiv.2411.18658,
title = {HDI-Former: Hybrid Dynamic Interaction ANN-SNN Transformer for Object Detection Using Frames and Events},
author = {Dianze Li and Jianing Li and Xu Liu and Zhaokun Zhou and Xiaopeng Fan and Yonghong Tian},
journal= {arXiv preprint arXiv:2411.18658},
year = {2024}
}
备注
17 pages, 11 figures