EgoEV-HandPose: 基于立体事件相机的自我中心3D手姿估计与手势识别
计算机视觉与模式识别
2026-05-13 v1 机器人学
图像与视频处理
摘要
自我中心3D手姿估计和手势识别对于沉浸式增强/虚拟现实、人机交互和机器人人来说至关重要。然而,传统的基于帧的方法相机受到运动模糊和动态范围受限的限制,而现有的基于事件的方法则受到ego-motion干扰、单目深度模糊以及缺乏大规模真实世界立体数据集的限制。为克服这些限制,我们提出EgoEV-HandPose,一个用于从立体事件流进行联合3D双手姿态估计和手势识别的端到端框架。我们方法的核心是KeypointBEV,一种灵活的立体融合模块,将特征提升到标准鸟瞰视角空间,并采用迭代的重投影引导的细化循环,逐步解决深度不确定性并强制执行运动学一致性。此外,我们引入EgoEVHands,首个大规模真实世界立体事件相机数据集,用于自我中心手 perception,包含5,419个标注序列,覆盖38个手势类别,在不同照明条件下提供稠密3D/2D关键点。广泛的实验表明,EgoEV-HandPose以30.54mm的MPJPE和86.87%的Top-1手势识别准确率实现了最先进的性能,显著优于基于RGB的立体方法和先前的基于事件的相机方法,特别是在低光照和双手遮挡场景下,从而为基于事件的自我中心感知树立了新的基准。该建立的数据集和源代码将在https://github.com/ZJUWang01/EgoEV-HandPose公开发布。
引用
@article{arxiv.2605.12297,
title = {EgoEV-HandPose: Egocentric 3D Hand Pose Estimation and Gesture Recognition with Stereo Event Cameras},
author = {Luming Wang and Hao Shi and Jiajun Zhai and Kailun Yang and Kaiwei Wang},
journal= {arXiv preprint arXiv:2605.12297},
year = {2026}
}
备注
Extended version of SMC 2025 paper arXiv:2503.12419. The established dataset and source code will be publicly released at https://github.com/ZJUWang01/EgoEV-HandPose