中文

Faetar 基准:极低资源语言的语音识别

计算与语言 2025-05-27 v4 声音 音频与语音处理

摘要

我们引入了 Faetar 自动语音识别基准,这是一个旨在挑战当前低资源语音识别方法极限的基准语料库。Faetar 是一种主要在意大利使用的法兰克-普罗旺斯语变体,没有标准正字法,除了基准中包含的内容外,几乎没有现成的文本或语音资源,并且与其他形式的法兰克-普罗旺斯语有很大不同。该语料库来自现场录音,其中大部分带有噪声,只有 5 小时有匹配的转录,且强制对齐的质量参差不齐。该语料库还包含额外的 20 小时未标注语音。我们报告了最先进的多语言语音基础模型的基线结果,在使用未标注集对基础模型进行持续预训练的流程下,最佳音素错误率为 30.4%。

关键词

引用

@article{arxiv.2409.08103,
  title  = {The Faetar Benchmark: Speech Recognition in a Very Under-Resourced Language},
  author = {Michael Ong and Sean Robertson and Leo Peckham and Alba Jorquera Jimenez de Aberasturi and Paula Arkhangorodsky and Robin Huo and Aman Sakhardande and Mark Hallap and Naomi Nagy and Ewan Dunbar},
  journal= {arXiv preprint arXiv:2409.08103},
  year   = {2025}
}

备注

To appear in INTERSPEECH 2025