面向端到端语音识别的终身学习
计算与语言
2021-07-05 v3 音频与语音处理
摘要
当今的自动语音识别(ASR)技术主要针对给定数据集进行优化;因此,应用环境的任何变化(例如声学条件或主题领域)都可能不可避免地导致性能下降。我们可以收集描述新环境的新数据并微调系统,但这自然会导致早期数据集上更高的错误率,即所谓的灾难性遗忘。终身学习的概念旨在使机器能够从描述不断变化的现实世界的新数据集中顺序学习新任务而不遗忘先前学到的知识,因而受到关注。据我们所知,本文首次广泛考虑并分析了在端到端(E2E)ASR 中使用多种 LLL 方法,包括提出在保存过往领域数据以缓解灾难性遗忘问题方面的新方法。在三个差异很大的基准语料库上顺序学习时,与微调基线相比,词错误率(WER)总体相对降低了 28.7%。这可朝着高度期望的、能够与持续变化的现实世界同步的 ASR 技术迈出第一步。
引用
@article{arxiv.2104.01616,
title = {Towards Lifelong Learning of End-to-end ASR},
author = {Heng-Jui Chang and Hung-yi Lee and Lin-shan Lee},
journal= {arXiv preprint arXiv:2104.01616},
year = {2021}
}
备注
Interspeech 2021. We acknowledge the support of Salesforce Research Deep Learning Grant