中文

基于事件相机的高效第一人称视角 3D 手部跟踪——EvHand-FPV

计算机视觉与模式识别 2025-09-18 v1

摘要

手部跟踪具有令人期待的直观交互潜力,但基于帧的方法在准确性、低延迟和能源效率方面常常难以满足,尤其是在资源受限的环境中,如扩展现实 (XR) 设备。事件相机以 μs 级时间分辨率和 mW 级功耗实现异步亮度变化感知。本文提出 EvHand-FPV,一个用于来自单个事件相机的 egocentric 第一人称视角 3D 手部跟踪的轻量级框架。我们构建了一个结合合成训练数据与 3D 标签,以及真实事件数据与 2D 标签用于评估的基于事件的 FPV 数据集,以解决 egocentric 基准数据稀缺的问题。EvHand-FPV 还引入了基于腕部的感兴趣区域 (ROI),通过几何线索局部化手部区域,结合嵌入 ROI 偏移量的端到端映射策略以减少计算而无需显式重构,并采用带有辅助几何特征头的多任务学习策略以在无测试时开销的情况下提高表示。在我们的真实 FPV 测试集上,EvHand-FPV 将 2D-AUCp 从 0.77 提升到 0.85,参数从 11.2M 减少到 1.2M,降低 89%,每推理的 FLOPs 从 1.648G 降到 0.185G,降低 89%。它还在合成数据上保持了具竞争力的 3D-AUCp 为 0.84。这些结果表明该方法能够实现准确且高效的egocentric事件驱动手部跟踪,适用于设备内 XR 应用。数据集和代码均可在 https://github.com/zen5x5/EvHand-FPV 提供。

关键词

引用

@article{arxiv.2509.13883,
  title  = {EvHand-FPV: Efficient Event-Based 3D Hand Tracking from First-Person View},
  author = {Zhen Xu and Guorui Lu and Chang Gao and Qinyu Chen},
  journal= {arXiv preprint arXiv:2509.13883},
  year   = {2025}
}

备注

8 pages