无透镜相机所拍摄视频中的手势识别
计算机视觉与模式识别
2022-10-26 v1 图像与视频处理
摘要
无透镜相机是一种以掩模代替透镜的成像系统,相较有透镜相机更薄、更轻且成本更低。然而,图像重建需要额外复杂的计算与时间。本文提出一种名为Raw3dNet的深度学习模型,可直接对无透镜相机捕获的原始视频进行手势识别,无需图像复原。除节省计算资源外,这种免重建方法还提供隐私保护。Raw3dNet是一种用于无透镜成像系统中手势识别的新型端到端深度神经网络模型,专为无透镜相机捕获的原始视频设计,能够恰当提取并融合时空特征。该网络由两阶段组成:1. 空间特征提取器(SFE),在时间卷积前增强每帧的空间特征;2. 3D-ResNet,对视频流进行空间与时间卷积。所提模型在无透镜光学实验的Cambridge Hand Gesture数据集上达到98.59%准确率,与有透镜相机结果相当。此外,评估了物理物体识别的可行性。进一步,我们表明仅使用原始数据极小部分即可达到可观识别准确率,意味着在云计算场景中降低数据流量的潜力。
引用
@article{arxiv.2210.08233,
title = {Hand Gestures Recognition in Videos Taken with Lensless Camera},
author = {Yinger Zhang and Zhouyi Wu and Peiying Lin and Yang Pan and Yuting Wu and Liufang Zhang and Jiangtao Huangfu},
journal= {arXiv preprint arXiv:2210.08233},
year = {2022}
}