基于神经架构搜索与量化的端到端关键词 spotting
声音
2021-04-15 v1 机器学习
音频与语音处理
机器学习
摘要
本文引入神经架构搜索(NAS)用于在有限资源环境下自动发现端到端关键词 spotting(KWS)模型。我们采用可微 NAS 方法来优化在原始音频波形上运行的卷积神经网络(CNNs)的结构。在使用 NAS 找到合适的 KWS 模型后,我们对权重和激活进行量化以减小内存占用。我们在 Google speech commands 数据集上进行了大量实验。特别地,我们将端到端方法与基于梅尔频率倒谱系数(MFCC)的系统进行了比较。对于量化,我们比较了固定位宽量化和训练位宽量化。仅使用 NAS,我们便获得了一个高效模型,其准确率为 95.55%,参数量为 75.7k,运算量为 13.6M。使用训练位宽量化后,同一模型在每次激活平均仅用 2.91 位、每个权重平均仅用 2.51 位的情况下达到了 93.76% 的测试准确率。
引用
@article{arxiv.2104.06666,
title = {End-to-end Keyword Spotting using Neural Architecture Search and Quantization},
author = {David Peter and Wolfgang Roth and Franz Pernkopf},
journal= {arXiv preprint arXiv:2104.06666},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:2012.10138