中文

WolBanking77:沃洛夫语银行语音意图分类数据集

计算与语言 2025-10-28 v3 人工智能 机器学习

摘要

意图分类模型近年来取得了显著进展。然而,以往的研究主要聚焦于高资源语言数据集,这导致低资源语言以及高文盲率地区(在这些地区,语言的使用远多于阅读或书写)存在研究空白。以塞内加尔为例,约90%的人口使用沃洛夫语,而全国文盲率仍维持在42%。在西非地区,实际使用沃洛夫语的人口超过1000万。为弥补这些不足,我们推出了沃洛夫语银行语音意图分类数据集(WolBanking77),用于意图分类的学术研究。WolBanking77目前包含9,791条银行领域的文本句子以及超过4小时的语音句子。本工作在包括文本和语音领域SOTA模型在内的多种基线上进行了实验。在该当前数据集上的结果非常有前景。此外,本文对数据集内容进行了深入分析。我们报告了在WolBanking77数据集上训练的NLP和ASR模型的基线F1分数和词错误率指标,并对模型进行了比较。数据集和代码可在以下地址获取:https://github.com/abdoukarim/wolbanking77。

关键词

引用

@article{arxiv.2509.19271,
  title  = {WolBanking77: Wolof Banking Speech Intent Classification Dataset},
  author = {Abdou Karim Kandji and Frédéric Precioso and Cheikh Ba and Samba Ndiaye and Augustin Ndione},
  journal= {arXiv preprint arXiv:2509.19271},
  year   = {2025}
}

备注

10 pages, 7 figures