中文

基于 Sinc 卷积在原始音频数据上的小 footprint 关键词 spotting

音频与语音处理 2020-05-05 v2 计算与语言 声音

摘要

关键词 spotting (KWS) 实现了智能设备上基于语音的用户交互。智能设备的常开且由电池供电的应用场景对硬件资源和功耗提出了限制,同时也要求高精度以及实时能力。先前的架构首先提取声学特征,然后应用神经网络对关键词概率进行分类,并针对内存占用和执行时间进行优化。与先前出版物相比,我们采取了额外步骤来降低功耗和内存消耗而不降低分类精度。通过对原始音频直接分类,消除了耗电的音频预处理和数据传输步骤。为此,我们的端到端架构使用参数化 Sinc 卷积提取频谱特征。其内存占用通过分组深度可分离卷积进一步减小。我们的网络在 Google 的 Speech Commands 测试集上以仅 62k 参数取得了 96.4% 的竞争精度。

关键词

引用

@article{arxiv.1911.02086,
  title  = {Small-Footprint Keyword Spotting on Raw Audio Data with Sinc-Convolutions},
  author = {Simon Mittermaier and Ludwig Kürzinger and Bernd Waschneck and Gerhard Rigoll},
  journal= {arXiv preprint arXiv:1911.02086},
  year   = {2020}
}

备注

Accepted at ICASSP 2020