面向 prosthetic hands 的语音二维特征轨迹端到端学习
音频与语音处理
2020-11-30 v1 机器学习
机器人学
声音
系统与控制
系统与控制
摘要
语音是人类最常见的交流形式之一。语音指令是 prosthetic hands 多模态控制的重要组成部分。过去几十年中,研究者使用自动语音识别系统通过语音指令控制 prosthetic hands。自动语音识别系统学习如何将人类语音映射为文本,然后使用自然语言处理或查找表将估计的文本映射为轨迹。然而,传统语音控制 prosthetic hands 的性能仍不尽如人意。通用图形处理单元(GPGPU)的最新进展使智能设备能够实时运行深度神经网络。因此,智能系统的架构已从复合子系统优化范式迅速转变为端到端优化范式。本文提出一种端到端卷积神经网络(CNN),将语音二维特征直接映射为 prosthetic hands 的轨迹。所提出的卷积神经网络轻量,因而可在嵌入式 GPGPU 中实时运行。所提方法可使用任意类型的在每一维具有局部相关性的语音二维特征,如谱图、MFCC 或 PNCC。本文在控制 prosthetic hand 时省略了语音到文本的步骤。该网络使用带有 TensorFlow 后端的 Keras 库以 Python 编写。我们针对 NVIDIA Jetson TX2 开发套件优化了 CNN。在该 CNN 上的实验显示出均方根误差为 0.119,且生成对应于语音输入数据的轨迹输出运行时间为 20ms。为在实时下获得更低误差,我们可针对更强大的嵌入式 GPGPU(如 NVIDIA AGX Xavier)优化类似的 CNN。
引用
@article{arxiv.2009.10283,
title = {End-to-End Learning of Speech 2D Feature-Trajectory for Prosthetic Hands},
author = {Mohsen Jafarzadeh and Yonas Tadesse},
journal= {arXiv preprint arXiv:2009.10283},
year = {2020}
}