中文

通过端侧可学习的用户语音特征提升关键词检测

声音 2024-03-13 v1 机器学习 音频与语音处理

摘要

面向常开型TinyML约束应用的关键词检测系统,在未见过的推理条件下部署时,需要进行现场微调以提升离线训练分类器的准确率。适应目标用户的语音特征需要大量领域内样本,这在现实场景中通常难以获取。此外,当前的端侧学习技术依赖于计算密集且内存消耗大的骨干网络更新方案,不适合常开型电池供电设备。在本工作中,我们提出了一种新颖的端侧学习架构,由预训练骨干网络和感知用户的嵌入层组成,后者用于学习用户的语音特征。生成的特征被融合并用于对输入话语进行分类。对于由未见说话者引起的领域偏移,基于Google Speech Commands数据集的35类问题,我们通过对用户投影进行低成本更新,测得错误率降低了高达19%(从30.1%降至24.3%)。我们进一步展示了所提架构在样本稀缺和类别稀缺学习条件下的少样本学习能力。该系统用于端侧训练仅需23.7千参数和每epoch 1 MFLOP的计算量,适用于面向电池供电微控制器的TinyML应用。

关键词

引用

@article{arxiv.2403.07802,
  title  = {Boosting keyword spotting through on-device learnable user speech characteristics},
  author = {Cristian Cioflan and Lukas Cavigelli and Luca Benini},
  journal= {arXiv preprint arXiv:2403.07802},
  year   = {2024}
}

备注

5 pages, 3 tables, 2 figures. Accepted as a full paper by the tinyML Research Symposium 2024