中文

在资源受限设备上使用早退机制训练动态模型用于自动语音识别

音频与语音处理 2024-02-23 v2 计算与语言 声音

摘要

在推理过程中动态调整神经模型计算负载的能力,对于具有有限且时变计算资源的设备端处理场景至关重要。早退架构是一种有前景的解决方案,其在编码器中间层附加额外的退出分支。在用于自动语音识别(ASR)的自注意力模型中,早退架构使得开发能够根据计算资源与ASR性能需求变化而调整自身规模与架构的动态模型成为可能。先前关于早退ASR模型的研究依赖于预训练的自监督模型,并使用早退损失进行微调。本文中,我们对微调预训练骨干网络与以早退目标从头训练模型进行了实验比较。在公开数据集上的实验表明,从头训练的早退模型不仅在使用更少编码器层时保持性能,而且相比单退出或预训练模型展现出更强的任务精度。此外,我们探索了一种基于后验概率的退出选择策略,作为传统基于帧的熵方法的替代。结果为ASR模型早退架构的训练动态提供了见解,特别是训练策略与退出选择方法的有效性。

关键词

引用

@article{arxiv.2309.09546,
  title  = {Training dynamic models using early exits for automatic speech recognition on resource-constrained devices},
  author = {George August Wright and Umberto Cappellazzo and Salah Zaiem and Desh Raj and Lucas Ondel Yang and Daniele Falavigna and Mohamed Nabih Ali and Alessio Brutti},
  journal= {arXiv preprint arXiv:2309.09546},
  year   = {2024}
}

备注

Accepted at the ICASSP Workshop Self-supervision in Audio, Speech and Beyond 2024