中文

Omni-sparsity DNN:基于超网的设备端流式端到端 ASR 快速稀疏优化

声音 2022-07-21 v2 计算与语言 音频与语音处理

摘要

从可穿戴设备到强大的智能设备,现代自动语音识别(ASR)模型运行于具有不同计算预算的各类边缘设备上。为在模型精度与模型大小的帕累托前沿上导航,研究人员陷入两难:为每个单独边缘设备训练并微调模型以优化精度,同时保持训练 GPU 小时数可控。本文中,我们提出 Omni-sparsity DNN,其中单个神经网络可被剪枝以生成适用于大范围模型大小的优化模型。我们为 Omni-sparsity DNN 开发了训练策略,使其能在词错率(WER)与模型大小的帕累托前沿上找到模型,同时将训练 GPU 小时数保持在不超过训练单个模型。我们以流式端到端 ASR 模型展示 Omni-sparsity DNN。我们的结果显示,与单独剪枝的稀疏模型相比,在 LibriSpeech 上训练时间和资源大幅节省且精度相似或更好:在 Test-other 上 WER 提升 2%-6.6%。

关键词

引用

@article{arxiv.2110.08352,
  title  = {Omni-sparsity DNN: Fast Sparsity Optimization for On-Device Streaming E2E ASR via Supernet},
  author = {Haichuan Yang and Yuan Shangguan and Dilin Wang and Meng Li and Pierce Chuang and Xiaohui Zhang and Ganesh Venkatesh and Ozlem Kalinli and Vikas Chandra},
  journal= {arXiv preprint arXiv:2110.08352},
  year   = {2022}
}