中文

强调未见词:面向端到端语音识别的新词汇习得

计算与语言 2023-02-22 v2 声音 音频与语音处理

摘要

由于人类语言的动态特性,自动语音识别(ASR)系统需要持续习得新词汇。词汇表外(OOV)词,如趋势词与新命名实体,给现代ASR系统带来问题,因其需长时间训练以调整大量参数。与多数先前聚焦语言模型后处理的研究不同,我们在更早的处理层级解决该问题,并消除声学建模中的偏置以从声学上识别OOV词。我们提出使用文本转语音系统生成OOV词,并重新缩放损失以促使神经网络更多关注OOV词。具体而言,在合成音频上微调预训练模型时,我们放大含OOV词语句(句子级)训练神经网络参数所用的分类损失,或重新缩放OOV词用于反向传播的梯度(词级)。为克服灾难性遗忘,我们还探索了损失重缩放与模型正则化(即L2正则化与弹性权重巩固(EWC))的结合。相较于仅用EWC微调合成音频的先前方法,LibriSpeech基准上的实验结果表明,我们提出的损失重缩放方法在召回率上取得显著提升,且仅带来词错误率的轻微下降。此外,词级重缩放比语句级重缩放更稳定,并在OOV词识别上带来更高召回率与精确率。进而,我们提出的损失重缩放与权重巩固结合方法可支持ASR系统的持续学习。

关键词

引用

@article{arxiv.2302.09723,
  title  = {Emphasizing Unseen Words: New Vocabulary Acquisition for End-to-End Speech Recognition},
  author = {Leyuan Qu and Cornelius Weber and Stefan Wermter},
  journal= {arXiv preprint arXiv:2302.09723},
  year   = {2023}
}

备注

Neural Networks, Volume 161, April 2023, Pages 494-504