中文

尼日利亚多方言语音翻译基准: NaijaS2ST

声音 2026-04-20 v1

摘要

低资源语言的语音翻译在很大程度上受限于稀缺的高质量、多样化的平行语音数据,这在非洲语言语境中尤为突出。为此,我们引入 NaijaS2ST,一个覆盖 Igbo、Hausa、Yor\`ub\`a 和尼日利亚皮恩语(Nigerian Pidgin)的平行语音翻译数据集,配对英文语料。该数据集约包含每个语言约 50 小时的语音,捕获了说话者和方言的显著变异,反映了真实的多语言和多方言环境。借助 NaijaS2ST,我们对级联、端到端(E2E)和 AudioLLM 基于方法进行了全面基准测试,涵盖双向翻译场景。我们的结果表明,具备 few-shot 示例的 audio LLM 在语音到文本翻译中优于在微调数据上训练的级联和端到端方法。然而,在语音到语音翻译中,级联和 audio LLM 方法的表现相当,这表明针对该场景开发有针对性的任务模型仍有很大的改进空间。通过提供高质量数据集和系统性基准,NaijaS2ST 希望为低资源、多语言语音翻译研究提供强大的基础。

关键词

引用

@article{arxiv.2604.16287,
  title  = {NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages},
  author = {Marie Maltais and Yejin Jeon and Min Ma and Shamsuddeen Hassan Muhammad and Idris Abdulmumin and Maryam Ibrahim Mukhtar and Daud Abolade and Joel Okepefi and Johnson Sewedo and David Ifeoluwa Adelani},
  journal= {arXiv preprint arXiv:2604.16287},
  year   = {2026}
}

备注

Preprint