MSRS:使用稀疏掩码优化从头训练多模态语音识别模型
计算机视觉与模式识别
2024-06-26 v1 多媒体
摘要
预训练模型是语音识别中的基础方法,虽然带有额外成本。在本研究中,我们提出一种正则化技术,促进视觉和音视频语音识别模型(VSR 和 AVSR)从头开始训练。该方法缩写为MSRS(Multimodal Speech Recognition from Scratch),引入稀疏正则化,在训练初期快速学习稀疏结构,这种稀疏结构在稠密模型中接收更健康的梯度流动。一旦稀疏掩码稳定,我们的方法允许过渡到稠密模型或保持稀疏模型通过更新非零值。MSRS在VSR和AVSR上分别以21.1%和0.9%的 WER 实现了有竞争力的成绩,训练时间缩短至少为2倍。我们探索了其他稀疏方法,表明只有MSRS能够通过隐式屏蔽受消失梯度影响的权重实现从头训练。
引用
@article{arxiv.2406.17614,
title = {MSRS: Training Multimodal Speech Recognition Models from Scratch with Sparse Mask Optimization},
author = {Adriana Fernandez-Lopez and Honglie Chen and Pingchuan Ma and Lu Yin and Qiao Xiao and Stavros Petridis and Shiwei Liu and Maja Pantic},
journal= {arXiv preprint arXiv:2406.17614},
year = {2024}
}
备注
Accepted at Interspeech 2024