中文

用于设备端语音识别的 Conformer Transducer 多阶段渐进压缩

声音 2022-10-04 v1 机器学习 音频与语音处理

摘要

智能设备中较小的内存带宽促使人们开发更小的自动语音识别(ASR)模型。为获得更小的模型,可采用模型压缩技术。知识蒸馏(KD)是一种流行的模型压缩方法,已被证明能以相对较小的模型性能下降实现更小的模型尺寸。在该方法中,知识从训练好的大尺寸教师模型蒸馏到小尺寸学生模型。此外,基于 transducer 的模型最近在设备端流式 ASR 任务中表现良好,而 conformer 模型能高效处理长期依赖。因此,本工作采用以 conformer 为编码器的流式 transducer 架构。我们提出一种利用 KD 压缩 conformer transducer 模型的多阶段渐进方法。在多阶段设置中,我们用蒸馏得到的学生模型逐步更新教师模型。在标准的 LibriSpeech 数据集上,我们的实验结果成功实现了超过 60% 的压缩率,且与较大的教师模型相比性能无显著下降。

关键词

引用

@article{arxiv.2210.00169,
  title  = {Multi-stage Progressive Compression of Conformer Transducer for On-device Speech Recognition},
  author = {Jash Rathod and Nauman Dawalatabad and Shatrughan Singh and Dhananjaya Gowda},
  journal= {arXiv preprint arXiv:2210.00169},
  year   = {2022}
}

备注

Published in INTERSPEECH 2022