中文

复杂度提升的自适应训练以提升低资源语音识别性能

声音 2024-12-03 v1 音频与语音处理

摘要

在ASR模型的整个训练过程中,数据增强强度和计算训练损失的方法都是基于预设参数进行规范化的。例如,SpecAugment采用预定义的增强强度对时频域谱的某些部分进行掩码。类似地,在基于CTC的多层模型中,损失通常基于编码器最终层的输出确定。在训练过程中忽略动态特性可能会导致次优训练。为此,我们提出了一种两阶段训练方法,称为复杂度提升的自适应(CBA)训练。它涉及对数据增强策略和CTC损失传播进行动态调整,基于训练样本的复杂度。在第一个阶段,我们使用中间CTC正则化和不带任何自适应策略的数据增强训练模型。在第二个阶段,我们提出一种新颖的自适应策略,称为MinMax-IBF,用于计算样本的复杂度。我们将MinMax-IBF策略与数据增强和中间CTC损失正则化相结合,继续训练。提出的CBA训练方法在ASR模型训练中显示出显著的改进, 在 LibriSpeech 100h test-clean 和 test-other 数据集上分别实现了最高13.4%和14.1%的相对WER降低, 在 AISHELL-1 test 集上实现了最高6.3%的相对降低, 相对于Wenet中的Conformer架构。

关键词

引用

@article{arxiv.2412.00877,
  title  = {Complexity boosted adaptive training for better low resource ASR performance},
  author = {Hongxuan Lu and Shenjian Wang and Biao Li},
  journal= {arXiv preprint arXiv:2412.00877},
  year   = {2024}
}