HoloEv-Net:基于全息空间嵌入和全局谱门控的高效事件驱动动作识别
计算机视觉与模式识别
2026-02-05 v1 人工智能
摘要
事件驱动动作识别(EAR)因其高时序分辨率和高动态范围而受到广泛关注。然而,现有方法通常面临(i)稠密体素表示的计算冗余、(ii)多分支架构中固有的结构冗余,以及(iii)在捕捉全局运动模式时对谱信息的 underutilization。为解决这些挑战,我们提出了名为 HoloEv-Net 的高效 EAR 框架。首先,为同时解决表示和结构冗余问题,我们引入了紧凑型全息时空表示(CHSR)。 departing from 计算密集型体素网格,CHSR 隐式地将水平空间线索嵌入时间-高度(T-H)视图中,有效地在二维表示中保留了三维时空上下文。其次,为利用被忽视的谱线索,我们设计了全局谱门控(GSG)模块。通过利用快速傅里叶变换(FFT)在频域进行全局 token 混合,GSG 在几乎没有参数开销的同时增强了表示能力。大量实验表明,我们的框架具有良好的可扩展性和效果。具体而言,HoloEv-Net-Base 在 THU-EACT-50-CHL、HARDVS 和 DailyDVS-200 上实现了最先进的性能,分别 outperforming 现有方法10.29%、1.71% 和 6.25%。此外,我们轻量级变体 HoloEv-Net-Small 在保持高度竞争的精度的同时,实现了极致的效率,参数减少5.4倍,FLOPs减少300倍,延迟减少2.4倍,展示了其在边缘部署中的潜力。
引用
@article{arxiv.2602.04182,
title = {HoloEv-Net: Efficient Event-based Action Recognition via Holographic Spatial Embedding and Global Spectral Gating},
author = {Weidong Hao},
journal= {arXiv preprint arXiv:2602.04182},
year = {2026}
}