中文

通过辅助多任务训练实现嵌入式设备上的高效2.5D手部姿态估计

计算机视觉与模式识别 2019-09-16 v1 人机交互

摘要

2D 关键点估计是人体和手部 3D 姿态估计问题的重要前置步骤。在这项工作中,我们讨论了在内存和计算资源极度受限的嵌入式设备(如 AR/VR 可穿戴设备)上部署极高效率的 2.5D 手部姿态估计所需的数据、架构和训练流程。我们的 2.5D 手部姿态估计包括:在由深度传感器捕获的自我中心图像上进行关节位置的 2D 关键点估计,并利用相应深度值将其提升为 2.5D。我们的贡献有两点:(a) 我们讨论了数据标注与增强策略,以及网络架构中 collectively 导致 flop 数量为最先进 MobileNetV2 架构的 3%3\% 、参数数量为 2%2\% 的模块。(b) 我们提出了一种辅助多任务训练策略,用于补偿网络的小容量,同时达到与 MobileNetV2 相当的性能。我们经 32-bit 训练的模型内存占用小于 300 千字节,以大于 50 Hz 的频率运行且少于 35 MFLOPs。

关键词

引用

@article{arxiv.1909.05897,
  title  = {Efficient 2.5D Hand Pose Estimation via Auxiliary Multi-Task Training for Embedded Devices},
  author = {Prajwal Chidananda and Ayan Sinha and Adithya Rao and Douglas Lee and Andrew Rabinovich},
  journal= {arXiv preprint arXiv:1909.05897},
  year   = {2019}
}

备注

CVPR Workshop on Computer Vision for Augmented and Virtual Reality, Long Beach, CA, 2019