Fleurs-SLU:面向口语理解的大规模多语言基准
计算与语言
2025-08-15 v3 人工智能
摘要
口语理解(SLU)对半数没有正式书写系统的语言至关重要。与高资源语言不同,对于这些语言,我们无法将语音语义理解卸载到自动语音识别(ASR)和文本基准大语言模型(LLM)的级联系统中。即便是低资源语言也拥有书写系统,ASR由于缺乏双模态语音和文本训练数据仍然不可靠。尽管如此,多语言SLU的评估仅限于意图分类或语言识别等浅层任务。因此,我们提出Fleurs-SLU,一个覆盖(i) 102种语言、涵盖692小时语音的主题语音分类任务,以及(ii) 92种语言、涵盖944小时语音的多选问答听力理解任务的多语言SLU基准。我们在Fleurs-SLU上广泛评估端到端语音分类模型、级联系统(组合语音到文本转录与后续LLM分类)以及多模态语音-LLM。我们的结果表明,级联系统在多语言SLU中更稳健,尽管经过充分预训练的语音编码器在主题语音分类方面也能与之竞争。闭源语音-LLM匹配或超过级联系统的性能。我们观察到,稳健的多语言ASR、有效的语音到文本翻译与强大的多语言SLU之间存在强烈相关性,表明声学和语义语音表征之间存在相互益处。
引用
@article{arxiv.2501.06117,
title = {Fleurs-SLU: A Massively Multilingual Benchmark for Spoken Language Understanding},
author = {Fabian David Schmidt and Ivan Vulić and Goran Glavaš and David Ifeoluwa Adelani},
journal= {arXiv preprint arXiv:2501.06117},
year = {2025}
}