将HuBERT模型扩展至非洲语言:从Base到Large和XL
计算与语言
2025-12-01 v1
摘要
尽管近期在多语言语音处理方面取得了进展,但非洲语言在研究和部署系统中仍然不足,尤其是当针对低资源监督环境的强大、开放权重编码器时。无监督学习在此类环境中表现尤为突出,但大多数公开发布的针对非洲语音的模型仍处于BASE规模,尚未回答更大的编码器是否在仅使用非洲语音训练时能提供实质性益处,以及模型容量如何与数据组成相互作用。本工作通过引入 SSA-HuBERT-Large(3.17亿参数)和 SSA-HuBERT-XL(9.64亿参数),首个仅在非洲语音上训练的大规模模型,以及BASE规模的对应模型,来填补这一空白。我们将这些模型作为开放权重发布:请参见 https://huggingface.co/collections/Orange/african-speech-foundation-models。通过聚焦亚非洲语言、覆盖语音识别(ASR)和语言识别(LID)任务的严谨控制实验研究,我们展示了更大的架构显著性地通过有效利用大型音频数据集来提升性能。
引用
@article{arxiv.2511.23370,
title = {Scaling HuBERT for African Languages: From Base to Large and XL},
author = {Antoine Caubrière and Elodie Gauthier},
journal= {arXiv preprint arXiv:2511.23370},
year = {2025}
}
备注
Journ\'ee d'\'etudes AFIA-ATALA 2025 : Technologies linguistiques pour les langues peu dot\'ees