中文

面向低资源语言的加权交叉熵在多语言语音识别中的应用

计算与语言 2024-09-26 v1 声音 音频与语音处理

摘要

本文解决了将低资源语言集成到多语言自动语音识别(ASR)系统中的挑战。我们提出了一种将加权交叉熵(通常用于不平衡数据集)的新颖应用,以便在持续多语言学习的语境下,将低资源语言集成到预训练的多语言ASR模型中。我们对 Whisper 多语言ASR模型在五种高资源语言和一种低资源语言上进行微调,采用语言加权动态交叉熵和数据增强。结果表明,与仅进行微调且未采用本方法的模型相比,低资源语言的词错误率(WER)降低了6.69%,与原始 Whisper模型相比降低了48.86%。此外,本方法在六种语言上实现了平均3.29%的WER降低,且对高资源语言没有性能下降。

关键词

引用

@article{arxiv.2409.16954,
  title  = {Weighted Cross-entropy for Low-Resource Languages in Multilingual Speech Recognition},
  author = {Andrés Piñeiro-Martín and Carmen García-Mateo and Laura Docío-Fernández and María del Carmen López-Pérez and Georg Rehm},
  journal= {arXiv preprint arXiv:2409.16954},
  year   = {2024}
}

备注

5 pages, 1 figure. Presented at Interspeech 2024