中文

Casablanca:多方言阿拉伯语语音识别的数据集与模型

计算与语言 2024-10-08 v1

摘要

尽管语音处理领域近期取得了进展,但全球大多数语言和方言仍未被涵盖。这进一步加剧了既有的技术鸿沟,阻碍了技术和社会经济的包容性。这一挑战主要源于缺乏能够赋能多样化语音系统的数据集。本文通过提出 Casablanca,旨在为多个阿拉伯语方言缓解这一障碍。Casablanca 是一个大规模由社区驱动的数据收集与转录项目。数据集涵盖八个方言:阿尔及利亚方言、埃及方言、阿联酋方言、约旦方言、毛里塔尼亚方言、摩洛哥方言、巴勒斯坦方言和也门方言,并包含转录、性别、方言和代码切换的注释。我们还开发了若干强大的基线模型,利用 Casablanca 数据集。Casablanca 项目页面 accessible at: www.dlnlp.ai/speech/casablanca。

关键词

引用

@article{arxiv.2410.04527,
  title  = {Casablanca: Data and Models for Multidialectal Arabic Speech Recognition},
  author = {Bashar Talafha and Karima Kadaoui and Samar Mohamed Magdy and Mariem Habiboullah and Chafei Mohamed Chafei and Ahmed Oumar El-Shangiti and Hiba Zayed and Mohamedou cheikh tourad and Rahaf Alhamouri and Rwaa Assi and Aisha Alraeesi and Hour Mohamed and Fakhraddin Alwajih and Abdelrahman Mohamed and Abdellah El Mekki and El Moatez Billah Nagoudi and Benelhadj Djelloul Mama Saadia and Hamzah A. Alsayadi and Walid Al-Dhabyani and Sara Shatnawi and Yasir Ech-Chammakhy and Amal Makouar and Yousra Berrachedi and Mustafa Jarrar and Shady Shehata and Ismail Berrada and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2410.04527},
  year   = {2024}
}