中文

使用编码器提示实现多语言端到端语音识别的快速语言适应

声音 2024-06-19 v1 计算与语言 音频与语音处理

摘要

端到端多语言语音识别模型通过单一模型处理多种语言,通常包含语言识别以自动检测输入语音的语言。鉴于常见情形是语言已知,这些模型可通过使用语言信息作为提示来执行特定语言任务,这对基于注意力的编码器-解码器架构尤其有益。然而,Connectionist Temporal Classification (CTC) 方法通过联合解码和多任务训练来增强识别,通常不包含语言提示 due to its conditionally independent output tokens。为克服这一限制,我们在自条件 CTC 框架中引入编码器提示技术,实现了零样本语言特定适应。我们的方法在平均错误率下降低 28%,对低资源语言下降低 41%。

关键词

引用

@article{arxiv.2406.12611,
  title  = {Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting},
  author = {Yosuke Kashiwagi and Hayato Futami and Emiru Tsunoo and Siddhant Arora and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2406.12611},
  year   = {2024}
}

备注

Accepted by INTERSPEECH 2024