基于非 audible 声与深度学习的智能手机普适手势识别
声音
2021-08-05 v1 计算机视觉与模式识别
人机交互
机器学习
音频与语音处理
摘要
由于当今普适技术的巨大进步,新的普适方法已进入实践,以提供创新功能并推动新的人机交互研究。本文提出一种利用智能手机内置扬声器与麦克风的手势识别方法。所提系统由智能手机立体声扬声器发射超声声纳信号(不可闻声),再由智能手机麦克风接收,并通过卷积神经网络(CNN)处理以进行手势识别。提出数据增强技术以提升检测精度,并比较了三种双通道输入融合方法。第一种方法将双通道音频合并为单张输入频谱图图像。第二种方法通过拼接双通道频谱图进行早期融合。第三种方法采用晚期融合,具有两个卷积输入分支分别处理双通道频谱图,再由最后几层合并输出。我们的实验结果表明,对于公开数据集中给出的六种手势,基线检测精度达 93.58\%,前景可期。
引用
@article{arxiv.2108.02148,
title = {Pervasive Hand Gesture Recognition for Smartphones using Non-audible Sound and Deep Learning},
author = {Ahmed Ibrahim and Ayman El-Refai and Sara Ahmed and Mariam Aboul-Ela and Hesham M. Eraqi and Mohamed Moustafa},
journal= {arXiv preprint arXiv:2108.02148},
year = {2021}
}