中文

序列到序列语音识别中的语言无关语码转换

计算与语言 2023-07-04 v2 声音 音频与语音处理

摘要

语码转换(CS)是指交替使用来自不同语言的词语和短语的现象。尽管当今的神经端到端(E2E)模型在自动语音识别(ASR)任务上取得了最先进的性能,但众所周知这些系统非常依赖数据。然而,目前只有少量转写并对齐的 CS 语音可用。为克服该问题并训练能够转写 CS 语音的多语言系统,我们提出了一种简单而有效的数据增强方法,将不同源语言的音频及其对应标签进行拼接。通过使用该训练数据,我们的 E2E 模型在转写 CS 语音上有所改进,并在单语测试上超越了单语模型。结果表明,该增强技术甚至能将模型在训练时未见的句间语言切换上的性能提升 5.03% 的词错率(WER)。

关键词

引用

@article{arxiv.2210.08992,
  title  = {Language-agnostic Code-Switching in Sequence-To-Sequence Speech Recognition},
  author = {Enes Yavuz Ugan and Christian Huber and Juan Hussain and Alexander Waibel},
  journal= {arXiv preprint arXiv:2210.08992},
  year   = {2023}
}

备注

18 pages