中文

基于端到端的多任务学习方法实现语音与口音联合识别

音频与语音处理 2021-06-16 v1

摘要

在本文中,我们提出一种单一多任务学习框架,以同时执行端到端 (E2E) 语音识别 (ASR) 与口音识别 (AR)。所提框架不仅更紧凑,而且能取得与独立系统相当甚至更好的结果。具体而言,我们发现整体性能主要由 ASR 任务决定,且基于 E2E 的 ASR 预训练对于获得改进的性能(尤其对于 AR 任务)至关重要。此外,我们对所提方法进行了若干分析。首先,尽管 AR 任务的目标损失远小于其 ASR 对应项,但在联合目标函数中对 AR 任务采用较小的权重因子,才能为每个任务带来更好的结果。其次,我们发现仅共享编码器的少数几层比共享整个编码器能获得更好的 AR 结果。在实验中,所提方法产生的 WER 结果接近于最佳的独立 E2E ASR 系统,同时在测试集上对口音识别分别比独立方法和基于单任务的联合识别方法取得了 7.7% 和 4.2% 的相对提升。

关键词

引用

@article{arxiv.2106.08211,
  title  = {E2E-based Multi-task Learning Approach to Joint Speech and Accent Recognition},
  author = {Jicheng Zhang and Yizhou Peng and Pham Van Tung and Haihua Xu and Hao Huang and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2106.08211},
  year   = {2021}
}