中文

基于神经架构搜索与量化的端到端关键词 spotting

声音 2021-04-15 v1 机器学习 音频与语音处理 机器学习

摘要

本文引入神经架构搜索(NAS)用于在有限资源环境下自动发现端到端关键词 spotting(KWS)模型。我们采用可微 NAS 方法来优化在原始音频波形上运行的卷积神经网络(CNNs)的结构。在使用 NAS 找到合适的 KWS 模型后,我们对权重和激活进行量化以减小内存占用。我们在 Google speech commands 数据集上进行了大量实验。特别地,我们将端到端方法与基于梅尔频率倒谱系数(MFCC)的系统进行了比较。对于量化,我们比较了固定位宽量化和训练位宽量化。仅使用 NAS,我们便获得了一个高效模型,其准确率为 95.55%,参数量为 75.7k,运算量为 13.6M。使用训练位宽量化后,同一模型在每次激活平均仅用 2.91 位、每个权重平均仅用 2.51 位的情况下达到了 93.76% 的测试准确率。

关键词

引用

@article{arxiv.2104.06666,
  title  = {End-to-end Keyword Spotting using Neural Architecture Search and Quantization},
  author = {David Peter and Wolfgang Roth and Franz Pernkopf},
  journal= {arXiv preprint arXiv:2104.06666},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:2012.10138