中文

HDI-Former:用于帧和事件的对象检测的混合动态交互 ANN-SNN Transformer

人工智能 2024-12-02 v1 人机交互 机器学习

摘要

将帧和事件的互补优势已被广泛用于具有挑战性场景中的对象检测。然而,大多数对象检测方法使用两个独立的人工神经网络(ANN)分支,限制了两种视觉流之间的数据交互,并在低功耗条件下难以从事件流中提取时序线索。为解决这些挑战,我们提出了 HDI-Former,即一种混合动态交互 ANN-SNN Transformer,标志着首次尝试设计一种用于高精度和能效的对象检测的直接训练混合 ANN-SNN 架构,同时利用帧和事件。技术上,我们首先提出了一种语义增强的自注意力机制,以强化 ANN Transformer 分支中图像编码标记之间的相关性,以获得更好的性能。然后,我们设计了一个用于低功耗建模事件流时序线索的脉冲 Swin Transformer 分支。最后,我们提出了一种受生物启发的动态交互机制,用于 ANN 和 SNN 子网络之间的跨模态信息交互。结果表明,HDI-Former 在准确性上显著优于十一款最先进的方法和我们的四个基线。我们的 SNN 分支在相同架构下表现与 ANN 相当,同时在 DSEC-Detection 数据集上能耗降低了 10.57 倍。我们的开源代码已包含在补充材料中。

关键词

引用

@article{arxiv.2411.18657,
  title  = {ScaleViz: Scaling Visualization Recommendation Models on Large Data},
  author = {Ghazi Shazan Ahmad and Shubham Agarwal and Subrata Mitra and Ryan Rossi and Manav Doshi and Vibhor Porwal and Syam Manoj Kumar Paila},
  journal= {arXiv preprint arXiv:2411.18657},
  year   = {2024}
}

备注

Accepted at PAKDD 2024 (Oral)