以非洲为中心的自监督预训练:撒哈拉以南背景下的多语言语音表示
计算与语言
2024-04-23 v3 机器学习
声音
音频与语音处理
摘要
我们提出了第一个仅使用非洲语音训练的自监督多语言语音模型。该模型从撒哈拉以南非洲地区21种语言和方言的近60,000小时未标注语音片段中学习。在FLEURS-102数据集的SSA子集上,基于HuBERT_base (0.09B)架构的方法在ASR下游任务中表现出与FLEURS基准中提出的w2v-bert-51 (0.6B)预训练模型相竞争的结果,同时效率更高,使用的数据量少7倍,参数量少6倍。此外,在LID下游任务中,我们的方法比FLEURS基准的准确率高出22%以上。
引用
@article{arxiv.2404.02000,
title = {Africa-Centric Self-Supervised Pre-Training for Multilingual Speech Representation in a Sub-Saharan Context},
author = {Antoine Caubrière and Elodie Gauthier},
journal= {arXiv preprint arXiv:2404.02000},
year = {2024}
}
备注
To appear in AfricaNLP 2024