中文

量化并最大化后端噪声自适应对基于注意力的语音识别模型的益处

音频与语音处理 2021-09-27 v2 声音

摘要

本工作分析了基于注意力的双向长短期记忆 (BLSTM) 模型如何自适应于噪声增强语音。我们通过在微调期间冻结模型组件,识别了 BLSTM 模型中噪声自适应的关键组件。我们首先冻结较大的模型子网络,然后在确定编码器对噪声自适应的重要性后,在编码器中采取细粒度冻结方法。结果表明,第一编码器层对噪声自适应至关重要,且其权重比其他层更为重要。当在目标噪声环境下测试时,相对于从仅用干净语音预训练的模型进行微调,从用噪声语音预训练的模型在目标噪声环境下微调可带来显著的准确率收益。为此分析,我们制作了自己的数据集增强工具,并已开源以鼓励未来在 ASR 噪声自适应探索方面的努力。

关键词

引用

@article{arxiv.2105.01134,
  title  = {Quantifying and Maximizing the Benefits of Back-End Noise Adaption on Attention-Based Speech Recognition Models},
  author = {Coleman Hooper and Thierry Tambe and Gu-Yeon Wei},
  journal= {arXiv preprint arXiv:2105.01134},
  year   = {2021}
}

备注

Submitted to ENLSP 2021