中文

倾听世界改善语音命令识别

声音 2017-10-24 v1 人工智能 音频与语音处理

摘要

我们研究了应用于音频识别任务(如环境声音事件和语音命令)的卷积网络架构中的迁移学习。我们的关键发现是,不仅可以将表示从环境声音分类等不相关任务迁移到语音命令识别等以语音为中心的任务,而且这样做还能显著提高准确率。我们还研究了增加模型容量对音频迁移学习的影响,首先在两个音频数据集(UrbanSound8k 和新发布的 Google Speech Commands 数据集)上验证了计算机视觉领域已知的结果,即使用越来越深的网络可以获得更好的准确率。然后,我们提出了一种使用空洞卷积的简单多尺度输入表示,并证明它能够聚合更大的上下文并提高分类性能。此外,使用迁移学习和多尺度输入表示组合训练的模型仅需 40% 的训练数据,即可达到与使用 100% 训练数据从头训练的模型相似的准确率。最后,我们证明了多尺度输入和迁移学习之间存在正向交互效应,为这两种技术的联合应用提供了依据。

关键词

引用

@article{arxiv.1710.08377,
  title  = {Listening to the World Improves Speech Command Recognition},
  author = {Brian McMahan and Delip Rao},
  journal= {arXiv preprint arXiv:1710.08377},
  year   = {2017}
}

备注

8 pages