预热困境:学习率策略如何影响语音转文本模型的收敛
计算与语言
2025-05-30 v1
摘要
训练大规模模型不仅在资源需求方面带来挑战,在其收敛性方面亦然。因此,当模型规模增加时,学习率(LR)通常会降低。在语音转文本(S2T)训练中,这种简单的解决方案是不够的,因为考虑到更好的性能,使用了更复杂且进阶的 Transformer 架构变体——例如 Conformer 或 Branchformer。作为一种权宜之计,OWSM 设计了 LR 的双线性预热,在第一阶段将其增加到非常小的值,然后在第二阶段将其更新为更高的值。虽然这种解决方案在实践中效果良好,但它未与替代方案进行比较,也未研究不同 LR 预热调度对最终性能的影响。本文填补了这一空白,揭示了:i)大规模 S2T 训练需要次指数 LR 预热;ii)预热阶段较高的 LR 会加速初始收敛,但不会提升最终性能。
关键词
引用
@article{arxiv.2505.23420,
title = {The Warmup Dilemma: How Learning Rate Strategies Impact Speech-to-Text Model Convergence},
author = {Marco Gaido and Sara Papi and Luisa Bentivogli and Alessio Brutti and Mauro Cettolo and Roberto Gretter and Marco Matassoni and Mohamed Nabih and Matteo Negri},
journal= {arXiv preprint arXiv:2505.23420},
year = {2025}
}
备注
Accepted to IWSLT 2025