中文

使用语音大语言模型评估二语口语能力

计算与语言 2025-05-28 v1 声音 音频与语音处理

摘要

二语英语使用者群体的不断增长,增加了对开发用于口语语言评估 (SLA) 的自动评分器的需求。从历史上看,统计模型、文本编码器和自监督语音模型已被用于此任务。然而,级联系统存在信息丢失的问题,而端到端 (E2E) 评分器也有其局限性。随着多模态大语言模型 (LLM) 的最新进展,我们旨在探索其作为二语口语能力评分器的潜力并克服这些问题。在这项工作中,我们比较了使用回归和分类目标的各种训练策略。我们的结果表明,语音 LLM 优于所有先前有竞争力的基线,在两个数据集上取得了卓越的性能。此外,得益于 LLM 预训练期间获得的音频理解知识,训练后的评分器在跨部分或跨任务评估中展现出强大的泛化能力。

关键词

引用

@article{arxiv.2505.21148,
  title  = {Assessment of L2 Oral Proficiency using Speech Large Language Models},
  author = {Rao Ma and Mengjie Qian and Siyuan Tang and Stefano Bannò and Kate M. Knill and Mark J. F. Gales},
  journal= {arXiv preprint arXiv:2505.21148},
  year   = {2025}
}

备注

submitted to Interspeech