中文

改进多语言语音识别系统的双阶段转写方法

计算与语言 2024-10-22 v1 声音 音频与语音处理

摘要

端到端语音识别(ASR)系统正迅速取代其他建模方法,成为最先进的技术。针对提高其处理多语言能力的挑战,已引入多种技术。然而,由于不同语言书写脚本的差异,在对相似的声学单元进行解码时,它们不总是映射到目标语言中的合适 grapheme。这限制了模型在处理多语言 code-mixing 场景时的可扩展性和适应性。本文提出了一种构建语言无关的端到端模型的方法,该方法使用从多语言 grapheme 数据投影到更通用目标语言脚本中的 grapheme 集合进行训练。该方法可以避免 acoustic model 扩大感受野以覆盖更大空间的重新训练,并且可以轻松扩展到多个语言。实现这一方法的双阶段转写过程证明能最小化语音类别混淆。我们针对两种印度语言——尼泊尔语和泰卢固语,在 Devanagari 脚本中投影这些语言的原始 grapheme 空间,对采用该方法的端到端多语言语音识别系统进行了实验。在转写空间中,我们相较于其他语言依赖建模方法,实现了 20% 的词错误率(WER)和 24% 的字符错误率(CER)的相对降低。

关键词

引用

@article{arxiv.2410.14709,
  title  = {A two-stage transliteration approach to improve performance of a multilingual ASR},
  author = {Rohit Kumar},
  journal= {arXiv preprint arXiv:2410.14709},
  year   = {2024}
}