利用 RGB 图像进行基于事件的人体姿态估计预训练
计算机视觉与模式识别
2025-09-23 v1
摘要
本文提出了 RPEP,即首个利用标记 RGB 图像和无标记事件数据进行事件-based 3D 人体姿态估计的预训练方法。事件数据具有高度时间分辨率和低延迟等显著优势,但其在人体姿态估计中的应用仍受标记训练数据的稀缺限制。为此,我们将实际 RGB 数据集用于训练事件-based 估计器,通过构建伪事件-RGB 对,将事件数据生成并与 RGB 图像的真实姿态对齐。然而,现有的伪事件生成技术假设物体为静止状态,难以处理非静止、动态移动的手部。为克服这一问题,RPEP 引入了一种新颖的生成策略,将手部运动分解为更小的、逐步的运动。这种分解使我们能够捕捉关节运动的temporal变化,从而为动态手部构建更真实的事件数据。此外,RPEP 引入运动反转约束,对事件生成进行正则化。大量实验表明,我们的预训练模型在真实事件数据上显著优于最先进的方法,在 EvRealHands 数据集上提升最高可达 24%。此外,本方法在最小化标记样本的情况下仍能实现强大的性能,非常适合实际部署。
引用
@article{arxiv.2509.16949,
title = {Leveraging RGB Images for Pre-Training of Event-Based Hand Pose Estimation},
author = {Ruicong Liu and Takehiko Ohkawa and Tze Ho Elden Tse and Mingfang Zhang and Angela Yao and Yoichi Sato},
journal= {arXiv preprint arXiv:2509.16949},
year = {2025}
}