中文

RoDia:用于罗马尼亚语方言语音识别的新数据集

计算与语言 2024-03-22 v3 声音 音频与语音处理

摘要

我们介绍了 RoDia,这是首个用于罗马尼亚语方言语音识别的数据集。RoDia 数据集包含来自罗马尼亚五个不同地区、涵盖城乡环境的多样化语音样本汇编,总计 2 小时人工标注的语音数据。除数据集外,我们提供了一组竞争性模型作为未来研究的基线。得分最高的模型取得了 59.83% 的宏 F1 分数和 62.08% 的微 F1 分数,表明该任务具有挑战性。因此我们相信 RoDia 是一项宝贵资源,将促进旨在应对罗马尼亚语方言识别挑战的研究。我们在 https://github.com/codrut2/RoDia 发布了数据集。

关键词

引用

@article{arxiv.2309.03378,
  title  = {RoDia: A New Dataset for Romanian Dialect Identification from Speech},
  author = {Codrut Rotaru and Nicolae-Catalin Ristea and Radu Tudor Ionescu},
  journal= {arXiv preprint arXiv:2309.03378},
  year   = {2024}
}

备注

Accepted at NAACL 2024