中文

CAFE:一个新颖的阿尔及利亚方言-法语-英语代码转换数据集

声音 2024-11-22 v1 计算与语言 音频与语音处理

摘要

本文介绍并公开发布(接受后提供数据下载链接)CAFE——首个阿尔及利亚方言、法语和英语之间的代码转换数据集。CAFE语音数据的独特之处在于:(a)其自发的说话风格,在体内的人-人对话中捕捉代码转换和重叠语音等现象;(b)解决了北非阿拉伯方言中独特的语言挑战;(c)CAFE捕捉了阿尔及利亚不同地区在不同社会语言学背景下的方言变体。CAFE数据包含约37小时的语音,其中子集CAFE-small(2小时36分钟)发布了人工标注,包括语音分割、转录、代码转换点的显式标注、重叠语音以及其他事件(如噪声、笑声等)。其余约34.58小时包含伪标签转录。除了数据发布,本文还强调了使用最先进的自动语音识别(ASR)模型(如Whisper large-v2,3和PromptingWhisper)处理此类内容所面临的挑战。随后,我们使用上述Whisper模型对CAFE数据进行基准测试,并展示了精心设计的数据处理流水线和先进解码技术如何提高ASR性能,混合错误率(MER)为0.310,字符错误率(CER)为0.329,词错误率(WER)为0.538。

关键词

引用

@article{arxiv.2411.13424,
  title  = {CAFE A Novel Code switching Dataset for Algerian Dialect French and English},
  author = {Houssam Eddine-Othman Lachemat and Akli Abbas and Nourredine Oukas and Yassine El Kheir and Samia Haboussi and Absar Chowdhury Shammur},
  journal= {arXiv preprint arXiv:2411.13424},
  year   = {2024}
}

备注

24 pages, submitted to tallip