中文

用于微型常开环境语音识别模型的低秩 Conformer 权重共享

音频与语音处理 2023-03-16 v1 人工智能 机器学习 声音

摘要

机器学习技术的持续进步通过更大模型与更大数据集的使用带来了令人振奋的新机遇。然而,在智能手机、可穿戴设备及其他可用内存极低的嵌入式环境等低功耗设备上提供这些新能力的需求日益增长。为此,我们考虑将基于 Conformer 的语音识别模型尺寸从通常需要大于 1 亿参数的模型缩减至仅 55 M 参数,同时最小化对模型质量的影响。此类模型使我们能在具有低内存神经处理器的边缘设备上实现常开环境语音识别。我们提出在模型架构内不同层级复用模型权重:(i)重复完整的 Conformer 块层,(ii)跨层共享特定 Conformer 模块,(iii)每个 Conformer 模块内共享子组件,以及(iv)低秩分解后共享分解的子组件权重。通过在不同层级共享权重,我们可在内存中保留完整模型,同时增加对输入应用的虚拟变换数量。经一系列消融研究与评估,我们发现借助权重共享与低秩架构,以 55 M 参数模型可在 Librispeech dev-clean 与 test-clean 上分别取得 2.84 与 2.94 的 WER。

关键词

引用

@article{arxiv.2303.08343,
  title  = {Sharing Low Rank Conformer Weights for Tiny Always-On Ambient Speech Recognition Models},
  author = {Steven M. Hernandez and Ding Zhao and Shaojin Ding and Antoine Bruguier and Rohit Prabhavalkar and Tara N. Sainath and Yanzhang He and Ian McGraw},
  journal= {arXiv preprint arXiv:2303.08343},
  year   = {2023}
}

备注

Accepted to IEEE ICASSP 2023