中文

基于口音特定码本的有口音语音识别

计算与语言 2023-10-30 v3 人工智能 机器学习

摘要

语音口音对最先进的自动语音识别(ASR)系统构成了重大挑战。代表性不足口音下的性能下降严重阻碍了ASR的包容性应用。在本工作中,我们提出了一种用于端到端ASR系统的新颖口音自适应方法,该方法利用带有可训练码本集合的交叉注意力。这些可学习的码本捕获口音特定信息,并集成于ASR编码器层中。模型在带口音的英语语音上训练,而测试数据也包含训练时未见的口音。在Mozilla Common Voice多口音数据集上,我们表明所提方法不仅在已见英语口音上取得了显著性能提升(词错率相对改善高达37%37\%),也在未见口音上取得了提升(WER相对改善高达5%5\%)。此外,我们展示了在L2Artic数据集上零样本迁移设置的优势。我们还与其他基于口音对抗训练的方法进行了性能比较。

关键词

引用

@article{arxiv.2310.15970,
  title  = {Accented Speech Recognition With Accent-specific Codebooks},
  author = {Darshan Prabhu and Preethi Jyothi and Sriram Ganapathy and Vinit Unni},
  journal= {arXiv preprint arXiv:2310.15970},
  year   = {2023}
}

备注

Accepted to EMNLP 2023 Main Conference (Long Paper)