用于语音控制假手的卷积神经网络
系统与控制
2020-01-03 v1 人机交互
机器学习
机器人学
声音
系统与控制
音频与语音处理
摘要
语音识别是人工智能的关键课题之一,因为它是人类最常见的交流形式之一。过去几十年中,研究人员利用结合神经网络与隐马尔可夫模型的传统语音识别系统,开发了许多语音控制假手。通用图形处理单元(GPGPU)的最新进展使智能设备能够实时运行深度神经网络。因此,最先进的语音识别系统已迅速从复合子系统优化范式转向端到端优化范式。然而,低功耗嵌入式 GPGPU 无法实时运行这些语音识别系统。在本文中,我们展示了在 NVIDIA Jetson TX2 开发者套件上实时运行的用于假手语音控制的深度卷积神经网络(CNN)的开发。首先,设备捕获语音并将其转换为二维特征(如频谱图)。CNN 接收二维特征并对手势进行分类。最后,手势类别被发送至假手运动控制系统。整个系统使用带有 TensorFlow 后端的深度学习库 Keras 以 Python 编写。我们在 CNN 上的实验展示了从语音命令到手势(文本输出)的 91% 准确率和 2ms 运行时间,可用于实时控制假手。
引用
@article{arxiv.1910.01918,
title = {Convolutional Neural Networks for Speech Controlled Prosthetic Hands},
author = {Mohsen Jafarzadeh and Yonas Tadesse},
journal= {arXiv preprint arXiv:1910.01918},
year = {2020}
}
备注
2019 First International Conference on Transdisciplinary AI (TransAI), Laguna Hills, California, USA, 2019, pp. 35-42