基于深度可分离卷积与压缩激励模块的轻量级关键词 spotting ResNet
声音
2021-07-23 v2 音频与语音处理
摘要
关键词 spotting 的一个难题是如何在保持高精度的同时缩小其内存占用。尽管卷积神经网络已被证明对轻量级关键词 spotting 问题有效,但它们仍需要数十万参数才能获得良好性能。本文提出一种基于深度可分离卷积层和压缩激励(squeeze-and-excitation)模块的高效模型。具体而言,我们用深度可分离卷积替代标准卷积,在不显著损失性能的前提下减少了标准卷积的参数数量。我们进一步通过一个所谓的压缩激励模块对第一卷积层输出特征图重新加权,从而提升深度可分离卷积的性能。我们在 Google Speech Commands 数据集的两种实验设置下将所提方法与五种代表性模型进行比较。实验结果表明,所提方法达到了最先进的性能。例如,在第一个实验中,它以 72K 的参数数量实现了 3.29% 的分类错误率,在相近模型规模下显著优于对比方法;它以 10K 的参数数量实现了 3.97% 的错误率,在相近模型规模下也略优于最先进的对比方法。
引用
@article{arxiv.2004.12200,
title = {Depthwise Separable Convolutional ResNet with Squeeze-and-Excitation Blocks for Small-footprint Keyword Spotting},
author = {Menglong Xu and Xiao-Lei Zhang},
journal= {arXiv preprint arXiv:2004.12200},
year = {2021}
}