用于小 footprint 语音词条分类的子带卷积神经网络
音频与语音处理
2019-07-03 v1 声音
摘要
本文提出一种用于语音词条分类的子带卷积神经网络。卷积神经网络(CNNs)已被证明在语音词条分类、关键词 spotting、说话人识别、声学事件检测等声学应用中非常有效。与计算机视觉中的应用不同,二维卷积核的空间不变性并不十分适合声学应用,因为在输入特征图中特定二维核的含义沿特征轴变化很大。我们提出一种子带 CNN 架构,在每个特征子带上应用不同的卷积核,使整体计算更高效。实验结果表明,子带 CNN 带来的计算效率对小 footprint 模型更为有益。在公开可用的 Speech Commands 数据集上,相较于用于语音词条分类的基线全带 CNN,所提子带 CNN 架构在指令分类上减少 39.7% 的计算量,在数字分类上减少 49.3% 的计算量,且准确率保持不变。
引用
@article{arxiv.1907.01448,
title = {Sub-band Convolutional Neural Networks for Small-footprint Spoken Term Classification},
author = {Chieh-Chi Kao and Ming Sun and Yixin Gao and Shiv Vitaladevuni and Chao Wang},
journal= {arXiv preprint arXiv:1907.01448},
year = {2019}
}
备注
Accepted by Interspeech 2019