印度语言的语码转换与语码混合语音识别
计算与语言
2022-06-14 v2 音频与语音处理
摘要
训练多语言自动语音识别(ASR)系统具有挑战性,因为声学与词汇信息通常是语言特定的。由于缺少开源数据集及不同方法的结果,训练印度语言的多语言系统更为困难。我们将端到端多语言语音识别系统的性能与以语言识别(LID)为条件的单语模型性能进行比较。来自多语言模型的解码信息用于语言识别,随后与单语模型结合,在各语言上获得 50% 的 WER 改善。我们还提出一种类似技术以解决语码转换问题,并在印地语-英语和孟加拉语-英语上分别取得 21.77 和 28.27 的 WER。我们的工作探讨了尤其以 wav2vec 2.0 为代表的基于 Transformer 的 ASR 如何应用于开发印度语言的多语言 ASR 与语码转换 ASR。
引用
@article{arxiv.2203.16578,
title = {Code Switched and Code Mixed Speech Recognition for Indic languages},
author = {Harveen Singh Chadha and Priyanshi Shah and Ankur Dhuriya and Neeraj Chhimwal and Anirudh Gupta and Vivek Raghavan},
journal= {arXiv preprint arXiv:2203.16578},
year = {2022}
}
备注
This paper for submitted to Interspeech 2022