中文

以非洲为中心的自监督预训练:撒哈拉以南背景下的多语言语音表示

计算与语言 2024-04-23 v3 机器学习 声音 音频与语音处理

摘要

我们提出了第一个仅使用非洲语音训练的自监督多语言语音模型。该模型从撒哈拉以南非洲地区21种语言和方言的近60,000小时未标注语音片段中学习。在FLEURS-102数据集的SSA子集上,基于HuBERT_base (0.09B)架构的方法在ASR下游任务中表现出与FLEURS基准中提出的w2v-bert-51 (0.6B)预训练模型相竞争的结果,同时效率更高,使用的数据量少7倍,参数量少6倍。此外,在LID下游任务中,我们的方法比FLEURS基准的准确率高出22%以上。

关键词

引用

@article{arxiv.2404.02000,
  title  = {Africa-Centric Self-Supervised Pre-Training for Multilingual Speech Representation in a Sub-Saharan Context},
  author = {Antoine Caubrière and Elodie Gauthier},
  journal= {arXiv preprint arXiv:2404.02000},
  year   = {2024}
}

备注

To appear in AfricaNLP 2024