中文

FLEURS-Kobani:面向北克尔米语的 FLEURS 数据集扩展

计算与语言 2026-04-01 v1

摘要

FLEURS 提供了 100 多种语言的 n 向平行语音,但北克尔米语(Northern Kurdish)不在其中,这限制了该语言在自动语音识别和语音翻译任务中的基准测试。我们提出 FLEURS-Kobani,作为 FLEURS 基准的北克尔米语(ISO 639-3 KMR) spoken 扩展版本。FLEURS-Kobani 数据集包含 5,162 条经验证的语音片段,总时长为 18 小时 24 分钟。数据由 31 位母语者录制。该数据集扩展了对一种资源匮乏的克尔米语方言的基准覆盖。作为基线,我们对 Whisper v3-large 进行了微调用于语音识别(ASR)和端到端语音到语音翻译(E2E S2TT)。采用两阶段微调策略(Common Voice 至 FLEURS-Kobani)可获得最佳的语音识别性能(测试集上 WER 为 28.11,CER 为 9.84)。对于端到端语音到语音翻译(KMR 到 EN),Whisper 实现了 8.68 BLEU。我们另外报告了基于 pivot 的目标以及级联式 S2TT 设置。FLEURS-Kobani 为 ASR、S2TT 和 S2ST 任务提供了首个公开的北克尔米语基准。该数据集在 CC BY 4.0 许可证下公开供研究使用。

关键词

引用

@article{arxiv.2603.29892,
  title  = {FLEURS-Kobani: Extending the FLEURS Dataset for Northern Kurdish},
  author = {Daban Q. Jaff and Mohammad Mohammadamini},
  journal= {arXiv preprint arXiv:2603.29892},
  year   = {2026}
}