中文

从零开始的低秩语音模型训练:现代语音识别模型的全秩不再是必需

声音 2024-10-11 v1 人工智能 计算与语言 计算机视觉与模式识别 音频与语音处理

摘要

本文探讨了针对大型Conformer-based语音识别模型从零开始进行低秩权重训练的这一较少探索的领域。我们的研究表明,这种训练范式对此类模型是可行的,产生成果令人振奋。首先,我们发现将注意力模块专门应用低秩结构反而会意外地提升性能,即使秩降低了12%。相比之下,前馈层则面临更大的挑战,因为它们在降低50%秩后就会出现性能下降。此外,我们发现初始化方法和层级秩分配在成功的低秩训练中起着关键作用。 Specifically,采用SVD初始化和线性层级秩映射显著提高了低秩权重训练的效果。基于这些见解,我们引入了从零开始的低秩语音模型(Low-Rank Speech Model from Scratch, LR-SMS),该方法在保持与全秩训练相当性能的同时,实现了参数数量至少降低2倍,语音识别(ASR)训练时间加速1.3倍,自动语音识别(AVSR)加速1.15倍。

关键词

引用

@article{arxiv.2410.07771,
  title  = {Full-Rank No More: Low-Rank Weight Training for Modern Speech Recognition Models},
  author = {Adriana Fernandez-Lopez and Shiwei Liu and Lu Yin and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2410.07771},
  year   = {2024}
}

备注

Submitted to ICASSP 2025