TODM:基于高效超网的一次训练多次部署的RNN-T压缩用于端侧ASR模型
计算与语言
2023-11-28 v2 机器学习
声音
音频与语音处理
摘要
自动语音识别(ASR)模型在部署到设备前需要针对特定硬件进行优化。这可以通过调整模型的超参数或探索其架构变体来实现。做出这些改动后重新训练和重新验证模型可能是一项资源密集型任务。本文提出TODM(一次训练多次部署,Train Once Deploy Many),一种高效训练多种尺寸的硬件友好型端侧ASR模型的新方法,其所需GPU小时数与单次训练任务相当。TODM利用先前Supernet工作的洞察,其中递归神经网络转导器(RNN-T)模型在Supernet内共享权重。它通过缩减Supernet的层大小和宽度获得子网络,使其成为适用于所有硬件类型的小型模型。我们引入了三种技术的新颖组合以改善TODM Supernet的结果:自适应dropout、原地Alpha散度知识蒸馏,以及ScaledAdam优化器的使用。我们使用LibriSpeech通过比较Supernet训练与单独调优的多头状态空间模型(MH-SSM)RNN-T来验证我们的方法。结果表明,我们的TODM Supernet在词错误率(WER)上匹配或超越手动调优模型,相对最高优3%,同时高效地将训练多个模型的成本保持在较小的常量。
引用
@article{arxiv.2309.01947,
title = {TODM: Train Once Deploy Many Efficient Supernet-Based RNN-T Compression For On-device ASR Models},
author = {Yuan Shangguan and Haichuan Yang and Danni Li and Chunyang Wu and Yassir Fathullah and Dilin Wang and Ayushi Dalmia and Raghuraman Krishnamoorthi and Ozlem Kalinli and Junteng Jia and Jay Mahadeokar and Xin Lei and Mike Seltzer and Vikas Chandra},
journal= {arXiv preprint arXiv:2309.01947},
year = {2023}
}
备注
Meta AI; Submitted to ICASSP 2024