中文

Tag-Team方法:利用CLS与语言标注增强多语言ASR

计算与语言 2023-06-01 v1 音频与语音处理

摘要

在像印度这样语言多样化的国家构建多语言自动语音识别(ASR)系统是一项具有挑战性的任务,原因在于文字系统的差异以及语音数据的有限可用性。这一问题可通过利用许多此类语言在语音上相似的事实来解决。这些语言可通过将相似发音映射到通用标签而转换为通用标签集(CLS)。本文中探索并比较了新方法来改进基于CLS的多语言ASR模型的性能。通过在CLS多语言模型之上赋予语言ID或使用CLS到原生文字转换器,将特定语言信息注入ASR模型中。与CLS基线相比,这些方法在词错误率(WER)上给出了显著改进。这些方法进一步在分布外数据上进行了尝试以检验其鲁棒性。

关键词

引用

@article{arxiv.2305.19584,
  title  = {The Tag-Team Approach: Leveraging CLS and Language Tagging for Enhancing Multilingual ASR},
  author = {Kaousheik Jayakumar and Vrunda N. Sukhadia and A Arunkumar and S. Umesh},
  journal= {arXiv preprint arXiv:2305.19584},
  year   = {2023}
}

备注

5 pages,5 figures, submitted to INTERSPEECH2023