中文

在不遗忘单语语音识别的前提下学习识别语码转换语音

音频与语音处理 2020-06-02 v1 计算与语言 声音

摘要

近年来,语码转换语音的自动语音识别(ASR)取得了显著进展,在许多语言对的语码转换数据集上准确率得到提升。语码转换语音与所混合的一种或两种语言的单语语音共存。在本工作中,我们表明在语码转换语音上微调 ASR 模型会损害单语语音上的性能。我们指出需要针对语码转换优化模型,同时确保不牺牲单语性能。单语模型可能在数千小时语音上训练,这些语音可能无法用于重新训练新模型。我们提出在仅能访问单语模型且无法获取其训练数据时,将学习无遗忘(LWF)框架用于语码转换 ASR。我们表明使用该框架训练模型使其在语码转换和单语测试集上均表现良好是可行的。在也能获取单语训练数据的情况下,我们提出用于语码转换微调而不牺牲单语准确性的正则化策略。我们报告了相较于使用合并数据和简单微调的基线,在单语和语码转换测试集上词错误率(WER)的改进。

关键词

引用

@article{arxiv.2006.00782,
  title  = {Learning to Recognize Code-switched Speech Without Forgetting Monolingual Speech Recognition},
  author = {Sanket Shah and Basil Abraham and Gurunath Reddy M and Sunayana Sitaram and Vikas Joshi},
  journal= {arXiv preprint arXiv:2006.00782},
  year   = {2020}
}

备注

5 pages (4 pages + 1 page references), 5 tables, 1 figure, 1 algorithm, 16 references