Mixat:阿拉伯语-英语双语阿拉伯酋长语音数据集
计算与语言
2024-05-07 v1
摘要
本文介绍了 Mixat:一个来自阿拉伯酋长语与英语混合言语的数据集。Mixat 是为了弥补当前语音识别资源在阿拉伯酋长语音识别方面的不足而开发的,特别是针对常常在本土方言与英语之间切换和混合的双语阿拉伯酋长语说话者。该数据集由来自两个公开播客的 15 小时语音资料组成,其中一个包含主持人与嘉宾之间的对话。因此,该集合包含阿拉伯酋长语-英语代码切换的示例,涵盖正式和自然对话情境。本文描述了数据收集和标注的过程,以及所得数据集的特征和统计信息。此外,我们评估了预训练的阿拉伯语和多语言语音识别系统在数据集上的性能,展示了现有模型在该低资源方言阿拉伯语以及识别代码切换方面的不足。该数据集将对科研开放使用。
引用
@article{arxiv.2405.02578,
title = {Mixat: A Data Set of Bilingual Emirati-English Speech},
author = {Maryam Al Ali and Hanan Aldarmaki},
journal= {arXiv preprint arXiv:2405.02578},
year = {2024}
}
备注
SIGUL 2024