中文

使用多 Softmax 注意力的流式双语端到端自动语音识别模型

音频与语音处理 2024-01-23 v1 计算与语言 声音

摘要

尽管多语言建模已取得多项进展,但在不知道输入语言的情况下使用单个神经模型识别多种语言仍具挑战性,且大多数多语言模型假设输入语言是已知的。在本工作中,我们提出了一种新颖的双语端到端(E2E)建模方法,其中单个神经模型可以识别两种语言并支持语言间的切换,而无需用户提供任何语言输入。所提出的模型具有共享的编码器和预测网络,以及通过自注意力机制组合的特定于语言的联合网络。由于特定于语言的后验概率被组合,它在所有输出符号上产生单一的后验概率,从而实现单一束搜索解码并允许语言间的动态切换。所提出的方法在印地语、英语和代码混合测试集上的词错误率相对降低分别为 13.3%、8.23% 和 1.3%,优于传统的双语基线。

关键词

引用

@article{arxiv.2401.11645,
  title  = {Streaming Bilingual End-to-End ASR model using Attention over Multiple Softmax},
  author = {Aditya Patil and Vikas Joshi and Purvi Agrawal and Rupesh Mehta},
  journal= {arXiv preprint arXiv:2401.11645},
  year   = {2024}
}

备注

Published in IEEE's Spoken Language Technology (SLT) 2022, 8 pages (6 + 2 for references), 5 figures