EgoEvGesture: 基于自我中心事件相机的手势识别
计算机视觉与模式识别
2025-07-22 v3 机器人学
图像与视频处理
光学
摘要
自我中心手势识别是增强自然人机交互的关键技术,但传统的基于RGB的方案在动态场景中易受运动模糊和光照变化的影响。虽然事件相机在处理高动态范围和超低功耗方面具有明显优势,但现有的基于RGB的架构因其同步帧式本质,在处理异步事件流时存在固有局限。此外,从自我中心视角来看,事件相机记录的数据包含头部运动和手势共同产生的事件,从而增加了手势识别的复杂性。为解决这一问题,我们提出了一种专门针对事件数据处理的新型网络架构,包括:(1) 采用非对称深度可分离卷积的轻量级CNN,以减少参数同时保留时空特征;(2) 作为上下文模块的即插即用状态空间模型,用于解耦头部运动噪声与手势动态;(3) 无参数的Bins-Temporal Shift Module(BTSM),沿分箱和时间维度移动特征以高效融合稀疏事件。我们进一步建立了EgoEvGesture数据集,这是首个用于自我中心手势识别的大规模事件相机数据集。实验结果表明,我们的方法在未见过的受试者上仅用7M参数即达到62.7%的准确率,比最先进方法高出3.1%。自由风格运动中的显著误分类源于高个体间差异性和与训练数据不同的未见测试模式。此外,我们的方法在DVS128 Gesture数据集上取得了97.0%的卓越准确率,证明了该方法在公开数据集上的有效性和泛化能力。数据集和模型已发布于 https://github.com/3190105222/EgoEv_Gesture。
引用
@article{arxiv.2503.12419,
title = {EgoEvGesture: Gesture Recognition Based on Egocentric Event Camera},
author = {Luming Wang and Hao Shi and Xiaoting Yin and Kailun Yang and Kaiwei Wang and Jian Bai},
journal= {arXiv preprint arXiv:2503.12419},
year = {2025}
}
备注
Accepted to SMC 2025. The dataset and models are made available at https://github.com/3190105222/EgoEv_Gesture