中文

基于无网格 MMI 的语音识别持续学习

音频与语音处理 2021-10-15 v1 计算与语言

摘要

持续学习(CL)或域扩展,近来成为自动语音识别(ASR)声学建模的热门话题,因为实际系统必须频繁更新以鲁棒地处理初始训练时未观察到的语音类型。虽然顺序自适应可将系统调谐至新域,但可能因灾难性遗忘导致旧域性能下降。在本工作中,我们探索基于正则化的 CL 用于以无网格最大互信息(LF-MMI)准则训练的神经网络声学模型。我们通过在不同包含多种口音和说话风格的公开数据集上增量自适应声学模型来模拟域扩展。我们研究了两种著名的 CL 技术:弹性权重巩固(EWC)和学而不忘(LWF),它们旨在通过保留模型权重或网络输出来减少遗忘。我们还引入了序列级 LWF 正则化,利用 LF-MMI 的分母图所得后验进一步减少遗忘。实证结果表明,与常规 LWF 相比,所提序列级 LWF 可将所有域上的最佳平均词错误率相对提升至多 9.4%。

关键词

引用

@article{arxiv.2110.07055,
  title  = {Continual learning using lattice-free MMI for speech recognition},
  author = {Hossein Hadian and Arseniy Gorin},
  journal= {arXiv preprint arXiv:2110.07055},
  year   = {2021}
}

备注

Submitted to ICASSP 2022 - IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) Copyright 2022 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses