中文

语音识别:通过图像识别实现关键词 spotting

机器学习 2020-11-25 v2 机器学习

摘要

由于噪声以及语速、音高等方面的变异性,识别语音指令一直是一项挑战。我们将比较几种神经网络架构在语音识别问题上的效能。具体而言,我们将构建一个模型来判断一秒长的音频片段是否包含特定词(从一组10个词中选取)、未知词或静音。待实现的模型包括 Tensorflow 语音识别教程推荐的 CNN、低延迟 CNN 以及对抗训练的 CNN。结果展示了如何将音频识别问题转化为研究更为充分的图像分类领域,其中卷积神经网络的强大技术已得到充分发展。此外,我们展示了虚拟对抗训练(Virtual Adversarial Training, VAT)技术在该问题领域的适用性,其作为一种强大的正则化器具有值得期待的未来应用潜力。

关键词

引用

@article{arxiv.1803.03759,
  title  = {Speech Recognition: Keyword Spotting Through Image Recognition},
  author = {Sanjay Krishna Gouda and Salil Kanetkar and David Harrison and Manfred K Warmuth},
  journal= {arXiv preprint arXiv:1803.03759},
  year   = {2020}
}