中文

用于语音识别模型终身学习的顺序编辑

计算与语言 2024-09-25 v2 声音 音频与语音处理

摘要

自动语音识别(ASR)传统上假设已知领域,但从新领域添加数据会引发与在现有和新领域上重新训练模型相关的计算效率低下问题。仅在新领域上进行微调存在灾难性遗忘(CF)的风险。为了解决这个问题,已经为ASR提出了终身学习(LLL)算法。先前的研究探索了诸如弹性权重巩固、知识蒸馏和重放等技术,所有这些都需要额外的参数或访问先前领域的数据。我们提出顺序模型编辑作为一种在ASR系统中持续学习新领域的新方法。与先前的方法不同,我们的方法不需要访问先前的数据集或引入额外的参数。我们的研究表明,与微调基线相比,词错误率降低(WERR)高达15%,并且在CommonVoice英语多口音数据集上,效率优于其他LLL技术。

关键词

引用

@article{arxiv.2406.17935,
  title  = {Sequential Editing for Lifelong Training of Speech Recognition Models},
  author = {Devang Kulshreshtha and Saket Dingliwal and Brady Houston and Nikolaos Pappas and Srikanth Ronanki},
  journal= {arXiv preprint arXiv:2406.17935},
  year   = {2024}
}

备注

INTERSPEECH 2024