中文

利用张量列网络混合模型进行语音指令识别

声音 2022-01-27 v1 机器学习 音频与语音处理

摘要

本工作旨在通过权衡模型参数数量与分类精度,设计一种低复杂度的语音指令识别(SCR)系统。更具体地,我们利用张量列(TT)网络的深度混合架构来构建端到端的SRC流水线。我们的指令识别系统,即CNN+(TT-DNN),底层由卷积层组成用于频谱特征提取,顶层由TT层组成用于指令分类。与传统的端到端CNN基线相比,我们提出的CNN+(TT-DNN)模型用TT层替换了全连接(FC)层,能够在保持CNN模型基线性能的同时大幅减少模型参数数量。我们以随机方式或基于训练良好的CNN+DNN来初始化CNN+(TT-DNN)模型,并在Google Speech Command Dataset上评估该模型。实验结果表明,所提出的CNN+(TT-DNN)模型在参数数量比CNN模型少4倍的情况下取得了96.31%的竞争性准确率。此外,当参数数量增加时,CNN+(TT-DNN)模型可达到97.2%的准确率。

关键词

引用

@article{arxiv.2201.10609,
  title  = {Exploiting Hybrid Models of Tensor-Train Networks for Spoken Command Recognition},
  author = {Jun Qi and Javier Tejedor},
  journal= {arXiv preprint arXiv:2201.10609},
  year   = {2022}
}

备注

Accepted in Proc. ICASSP 2022