中文

在自监督学习框架下改进口音识别与带口音语音识别

音频与语音处理 2021-09-16 v1 声音

摘要

近年来,自监督预训练在自动语音识别(ASR)中取得了成功。然而,考虑到真实场景中语音口音的差异,如何识别口音并利用口音特征改进 ASR 仍具挑战性。本文中,我们采用自监督预训练方法同时处理口音识别和带口音语音识别任务。对于前者,提出了一种基于标准差约束损失(SDC-loss)的端到端(E2E)架构来识别同一语言下的口音。对于带口音语音识别任务,我们设计了一个口音相关的 ASR 系统,其可利用额外的口音输入特征。此外,我们提出了一种帧级口音特征,它基于所提出的口音识别模型提取并可动态调整。我们使用 960 小时无标注 LibriSpeech 数据集预训练模型,并在 AESRC2020 语音数据集上微调。实验结果表明,我们提出的口音相关 ASR 系统显著优于 AESRC2020 基线,相较于我们的口音无关 ASR 系统实现了 6.5%6.5\% 的相对词错误率(WER)降低。

关键词

引用

@article{arxiv.2109.07349,
  title  = {Improving Accent Identification and Accented Speech Recognition Under a Framework of Self-supervised Learning},
  author = {Keqi Deng and Songjun Cao and Long Ma},
  journal= {arXiv preprint arXiv:2109.07349},
  year   = {2021}
}

备注

INTERSPEECH2021