U2++ MoE:参数规模扩展4.7倍,对RTF影响最小
计算与语言
2024-08-09 v2 音频与语音处理
摘要
规模扩展为自然语言处理开辟了新的前沿,但代价高昂。为此,通过学习和在训练与推理中仅激活参数子集,混合专家(MoE)被提出作为一种节能的路径,以构建更大、能力更强的语言模型,并且这种向新一代基础模型转变的趋势正在加速,尤其是在自动语音识别(ASR)领域。最近将MoE融入ASR模型的工作采用了复杂的设计,例如通过辅助嵌入网络路由帧、提高专家的多语言能力,以及利用专门的辅助损失进行专家负载均衡或特定语言处理。我们发现精细的设计并非必要,而将MoE层简单替换所有前馈网络(FFN)层对于ASR任务来说已经足够。更具体地说,我们在一个大规模内部数据集(16万小时)上对我们的模型进行了基准测试,结果表明我们可以将基线Conformer(Dense-225M)扩展到其MoE对应模型(MoE-1B),并达到Dense-1B级别的词错误率(WER),同时保持Dense-225M级别的实时因子(RTF)。此外,通过应用带有双向注意力解码器的统一两遍框架(U2++),我们在一个基于MoE的模型中实现了流式和非流式解码模式,我们称之为U2++ MoE。我们希望我们的研究能够在不牺牲部署效率的情况下,促进语音基础模型的扩展研究。
引用
@article{arxiv.2404.16407,
title = {U2++ MoE: Scaling 4.7x parameters with minimal impact on RTF},
author = {Xingchen Song and Di Wu and Binbin Zhang and Dinghao Zhou and Zhendong Peng and Bo Dang and Fuping Pan and Chao Yang},
journal= {arXiv preprint arXiv:2404.16407},
year = {2024}
}