基于多尺度时间卷积的小资源占用关键词 spotting
音频与语音处理
2020-10-21 v1 机器学习
声音
摘要
关键词 spotting (KWS) 在智能终端与服务机器人的人机交互中起着至关重要的作用。对于 KWS 任务,在小资源占用与高精度之间取得平衡仍具挑战性。本文探讨了多尺度时间建模在小资源占用关键词 spotting 任务中的应用。我们提出了多分支时间卷积模块 (MTConv),这是一种由多个具有不同核大小的时间卷积滤波器组成的 CNN 模块,可丰富时间特征空间。此外,利用时间卷积与深度可分离卷积的优势,我们为 KWS 系统设计了一种时间高效神经网络 (TENet)。基于所提出的模型,我们将标准时间卷积层替换为可训练以获得更优性能的 MTConv。而在推理阶段,MTConv 可等价转换为基础卷积架构,因此与基础模型相比不增加额外参数与计算开销。在 Google Speech Command Dataset 上的结果表明,我们使用 MTConv 训练的一个模型仅以 100K 参数实现了 96.8% 的准确率。
引用
@article{arxiv.2010.09960,
title = {Small-Footprint Keyword Spotting with Multi-Scale Temporal Convolution},
author = {Ximin Li and Xiaodong Wei and Xiaowei Qin},
journal= {arXiv preprint arXiv:2010.09960},
year = {2020}
}
备注
Accepted in INTERSPEECH 2020