基于口音特定码本的有口音语音识别
计算与语言
2023-10-30 v3 人工智能
机器学习
摘要
语音口音对最先进的自动语音识别(ASR)系统构成了重大挑战。代表性不足口音下的性能下降严重阻碍了ASR的包容性应用。在本工作中,我们提出了一种用于端到端ASR系统的新颖口音自适应方法,该方法利用带有可训练码本集合的交叉注意力。这些可学习的码本捕获口音特定信息,并集成于ASR编码器层中。模型在带口音的英语语音上训练,而测试数据也包含训练时未见的口音。在Mozilla Common Voice多口音数据集上,我们表明所提方法不仅在已见英语口音上取得了显著性能提升(词错率相对改善高达),也在未见口音上取得了提升(WER相对改善高达)。此外,我们展示了在L2Artic数据集上零样本迁移设置的优势。我们还与其他基于口音对抗训练的方法进行了性能比较。
引用
@article{arxiv.2310.15970,
title = {Accented Speech Recognition With Accent-specific Codebooks},
author = {Darshan Prabhu and Preethi Jyothi and Sriram Ganapathy and Vinit Unni},
journal= {arXiv preprint arXiv:2310.15970},
year = {2023}
}
备注
Accepted to EMNLP 2023 Main Conference (Long Paper)