中文

UME:升级混合专家以实现可扩展且高效的自动语音识别

音频与语音处理 2024-12-24 v1

摘要

近期大规模模型的发展显著提高了自动语音识别(ASR)任务中的性能。然而,从头训练大型ASR模型成本高昂。为此,我们引入了 UME,一种新颖的方法,有效地将预训练的稠密ASR检查点升级为更大的混合专家(MoE)架构。首先,转换前馈网络为 MoE 层。通过复用预训练权重,我们为扩大的模型建立了稳健的基础,显著减少了优化时间。随后,采用层冻结和专家平衡策略继续训练模型,以进一步提升性能。在由 17 万小时的中文和英文数据混合组成的数据集上进行实验,结果表明 UME:1)在保持可 comparable 延迟的同时,以约 11.9% 的相对错误率降幅超越预训练基线;2)训练时间缩短最高可达 86.7%,且准确率优于从头训练相同规模模型。

关键词

引用

@article{arxiv.2412.17507,
  title  = {UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition},
  author = {Li Fu and Shanyong Yu and Siqi Li and Lu Fan and Youzheng Wu and Xiaodong He},
  journal= {arXiv preprint arXiv:2412.17507},
  year   = {2024}
}

备注

ICASSP 2025