中文

AISPEECH-SJTU 用于带口音英语语音识别挑战赛的口音识别系统

声音 2021-02-22 v1 音频与语音处理

摘要

本文描述了 AISpeech-SJTU 参加 Interspeech-2020 带口音英语语音识别挑战赛口音识别赛道的系统。在该挑战赛道中,仅提供从 8 个国家收集的 160 小时带口音英语数据和辅助的 Librispeech 数据集用于训练。为构建准确且鲁棒的口音识别系统,我们详细探索了整个系统流程。首先,我们将基于 ASR 的音素后验图(PPG)特征引入口音识别并验证其有效性。然后,首次精心设计了一种基于 TTS 的方法来增广极为有限的口音训练数据。最后,我们提出了测试时增广与嵌入融合方案以进一步提升系统性能。我们的最终系统在挑战赛中排名第一,并以较大优势超越所有其他参赛队伍。所提交系统在挑战赛评测数据上取得了 83.63% 的平均准确率,绝对领先其他队伍超过 10%。

关键词

引用

@article{arxiv.2102.09828,
  title  = {AISPEECH-SJTU accent identification system for the Accented English Speech Recognition Challenge},
  author = {Houjun Huang and Xu Xiang and Yexin Yang and Rao Ma and Yanmin Qian},
  journal= {arXiv preprint arXiv:2102.09828},
  year   = {2021}
}

备注

Accepted to ICASSP 2021