中文

代表性不足语言的语音语言模型:来自沃洛夫语的洞见

计算与语言 2025-09-26 v2 声音 音频与语音处理

摘要

我们展示了为沃洛夫语——一种在西非使用的代表性不足语言——训练语音语言模型的历程,并分享了关键洞见。我们首先强调收集大规模、自发、高质量无监督语音数据的重要性,并表明在此数据集上对HuBERT进行持续预训练在自动语音识别(ASR)方面优于基础模型和非洲中心模型。然后,我们将该语音编码器集成到沃洛夫语大语言模型中,训练了该语言的首个语音大语言模型,将其能力扩展到语音翻译等任务。此外,我们探索了训练语音大语言模型在转录或翻译之前执行多步思维链。我们的结果表明,语音大语言模型不仅改善了语音识别,而且在语音翻译方面也表现出色。模型和代码将公开发布。

关键词

引用

@article{arxiv.2509.15362,
  title  = {Speech Language Models for Under-Represented Languages: Insights from Wolof},
  author = {Yaya Sy and Dioula Doucouré and Christophe Cerisara and Irina Illina},
  journal= {arXiv preprint arXiv:2509.15362},
  year   = {2025}
}