中文

基于学习缓存的微型设备语音理解

音频与语音处理 2024-05-09 v4 机器学习

摘要

本文解决了类微控制器嵌入式设备上的口语语言理解(SLU)问题,以新颖方式将设备端执行与云端卸载相结合。我们利用设备语音输入中的时间局部性,并相应复用近期的SLU推断结果。我们的思路简单:让设备将输入与缓存结果匹配,仅将未匹配任何缓存项的输入卸载至云端进行完整推断。然而,该思路的实现并非易事:设备需以稳健且低成本的方式比较声学特征。为此,我们提出SpeechCache(简称SC),一种面向微型设备的语音缓存。它在两种表征层级匹配语音输入:先通过聚类原始声音单元序列,再作为音素序列。两种表征协同工作,在成本与效率间提供互补权衡。为进一步提升精度,我们的缓存学习个性化:利用未匹配而后卸载的输入,在云端协助下持续微调设备的特征提取器。我们在现成STM32微控制器上实现SC。完整实现仅占用2MB小内存足迹。在具挑战性的语音基准上评估,我们的系统在设备端解析了45%–90%的输入,相较卸载至流行云端语音识别服务平均延迟降低达80%。即便在对抗性设置——噪声环境、冷缓存或多用户共用一设备下,所提SC带来的益处仍显著。

关键词

引用

@article{arxiv.2311.18188,
  title  = {Speech Understanding on Tiny Devices with A Learning Cache},
  author = {Afsara Benazir and Zhiming Xu and Felix Xiaozhu Lin},
  journal= {arXiv preprint arXiv:2311.18188},
  year   = {2024}
}

备注

accepted at MobiSys'24