中文

使用解耦Conformer的端侧语音识别持续学习

音频与语音处理 2023-05-26 v2 计算与语言 机器学习 声音

摘要

自动语音识别研究侧重于在静态数据集上训练和评估。然而,随着语音模型日益部署在个人设备上,此类模型会遇到用户特定的分布偏移。为模拟这一真实场景,我们引入了LibriContinual,一个源自LibriVox有声读物的说话人特定领域自适应持续学习基准,包含对应118位独立说话人的数据以及每位说话人6个不同规模的训练划分。此外,当前的语音识别模型和持续学习算法并未针对计算效率进行优化。我们将通用训练算法NetAug适配于ASR,并创建了一种称为DisConformer(解耦Conformer)的新型Conformer变体。该算法生成的ASR模型由一个用于通用目的的冻结“核心”网络以及多个用于说话人特定调优的可调“增强”网络组成。利用此类模型,我们提出了一种称为DisentangledCL的新型计算高效持续学习算法。我们的实验表明,DisConformer模型在通用ASR即LibriSpeech上显著优于基线(在test-other上相对WER降低15.58%)。在说话人特定的LibriContinual上,它们显著优于可训练参数量匹配的基线(在测试集上相对WER降低20.65%),并且在某些设置下甚至与完全微调的基线相当。

关键词

引用

@article{arxiv.2212.01393,
  title  = {Continual Learning for On-Device Speech Recognition using Disentangled Conformers},
  author = {Anuj Diwan and Ching-Feng Yeh and Wei-Ning Hsu and Paden Tomasello and Eunsol Choi and David Harwath and Abdelrahman Mohamed},
  journal= {arXiv preprint arXiv:2212.01393},
  year   = {2023}
}

备注

8 pages, 2 figures. Submitted to ICASSP 2023