中文

零样本语音大语言模型用于二语语音多维度评估:挑战与机遇

音频与语音处理 2026-01-26 v1 人工智能 计算与语言 声音

摘要

对二语英语发音的准确评估对于语言学习至关重要,因为它能提供个性化反馈并确保对个人进步进行公平评估。然而,由于句子层面的流利度、韵律和完整性的复杂性,自动评分仍然具有挑战性。本文评估了指令调优的语音大语言模型Qwen2-Audio-7B-Instruct在5000条Speechocean762语音样本上的零样本性能。该模型生成与评分标准一致的准确性、流利度、韵律和完整性分数,在±2容差范围内与人工评分显示出高度一致性,尤其是对于高质量语音。然而,它倾向于高估低质量语音的分数,并且在错误检测方面缺乏精度。这些发现证明了语音大语言模型在可扩展发音评估方面的巨大潜力,并提出了未来通过增强提示、校准和语音学集成来改进计算机辅助发音训练的途径。

关键词

引用

@article{arxiv.2601.16230,
  title  = {Zero-Shot Speech LLMs for Multi-Aspect Evaluation of L2 Speech: Challenges and Opportunities},
  author = {Aditya Kamlesh Parikh and Cristian Tejedor-Garcia and Catia Cucchiarini and Helmer Strik},
  journal= {arXiv preprint arXiv:2601.16230},
  year   = {2026}
}

备注

This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants which is financed by the Dutch Research Council (NWO)