语音识别训练中动态声学模型架构优化(DMAO)
计算与语言
2025-06-19 v2
摘要
架构设计本质上复杂。现有方法依赖手工设计规则,需要大量经验专业知识,或依赖神经架构搜索等自动化方法,计算开销大。在本文中,我们引入DMAO,一个采用增长与丢弃策略在训练期间自动重分配参数的架构优化框架。该重分配将资源从利用率较低的区域转移到模型中最受益的部分。值得注意的是,DMAO在给定模型复杂度下仅引入可忽略的训练开销。我们通过LibriSpeech、TED-LIUM-v2和Switchboard数据集上的CTC实验评估DMAO。结果表明,使用相同数量的训练资源,所提出的DMAO在各种架构、模型规模和数据集上一致地将WER相对提升高达6%。此外,我们分析了参数重分配的模式并揭示了深刻的发现。
引用
@article{arxiv.2506.13180,
title = {Dynamic Acoustic Model Architecture Optimization in Training for ASR},
author = {Jingjing Xu and Zijian Yang and Albert Zeyer and Eugen Beck and Ralf Schlueter and Hermann Ney},
journal= {arXiv preprint arXiv:2506.13180},
year = {2025}
}
备注
Accepted by Interspeech 2025