中文

基于多尺度时间卷积的小资源占用关键词 spotting

音频与语音处理 2020-10-21 v1 机器学习 声音

摘要

关键词 spotting (KWS) 在智能终端与服务机器人的人机交互中起着至关重要的作用。对于 KWS 任务,在小资源占用与高精度之间取得平衡仍具挑战性。本文探讨了多尺度时间建模在小资源占用关键词 spotting 任务中的应用。我们提出了多分支时间卷积模块 (MTConv),这是一种由多个具有不同核大小的时间卷积滤波器组成的 CNN 模块,可丰富时间特征空间。此外,利用时间卷积与深度可分离卷积的优势,我们为 KWS 系统设计了一种时间高效神经网络 (TENet)。基于所提出的模型,我们将标准时间卷积层替换为可训练以获得更优性能的 MTConv。而在推理阶段,MTConv 可等价转换为基础卷积架构,因此与基础模型相比不增加额外参数与计算开销。在 Google Speech Command Dataset 上的结果表明,我们使用 MTConv 训练的一个模型仅以 100K 参数实现了 96.8% 的准确率。

关键词

引用

@article{arxiv.2010.09960,
  title  = {Small-Footprint Keyword Spotting with Multi-Scale Temporal Convolution},
  author = {Ximin Li and Xiaodong Wei and Xiaowei Qin},
  journal= {arXiv preprint arXiv:2010.09960},
  year   = {2020}
}

备注

Accepted in INTERSPEECH 2020