中文

重放以记忆:面向德语语音识别的逐层特定持续微调

计算与语言 2023-10-19 v2 声音 音频与语音处理

摘要

尽管自动语音识别(ASR)模型随着无监督或自监督训练技术的引入取得了显著进展,这些改进仍仅限于部分语言与说话者。迁移学习使得大规模多语言模型不仅可适配低资源语言,也可适配更特定的说话者群体。然而,在新领域数据上微调通常伴随原领域性能下降。因此,在我们的实验中,我们考察大规模 ASR 模型在较小领域(使用我们自己的德语老年语音指令数据集 SVC-de)上的性能可逼近程度,以及通过在训练中有选择地冻结模型部分所能保留的通用语音识别性能程度。为进一步提升 ASR 模型对微调领域外词汇与说话者的鲁棒性,我们应用经验重放(Experience Replay)进行持续学习。仅添加原领域的一小部分数据,我们便能在新领域达到低于 5% 的词错率(WER),同时将通用语音识别性能稳定在可接受的 WER 水平。

关键词

引用

@article{arxiv.2307.07280,
  title  = {Replay to Remember: Continual Layer-Specific Fine-tuning for German Speech Recognition},
  author = {Theresa Pekarek Rosin and Stefan Wermter},
  journal= {arXiv preprint arXiv:2307.07280},
  year   = {2023}
}

备注

13 pages, 7 figures, accepted and presented at ICANN 2023