面向多维度、多评委 L2 阅读-语音评估的 Rubric-Guided 语音 LLM 微调
计算与语言
2026-03-19 v1 人工智能
声音
音频与语音处理
摘要
可靠且可解释的第二语言(L2)语音自动评估始终是核心挑战,因为大型语音语言模型(SpeechLLM)往往难以与人类评委的细微变动性相匹配。为此,我们提出了一个以 Rubric-Guided 推理框架,显式编码多维度人类评估标准:准确性、流畅性和韵律,同时校准模型不确定性以捕捉自然评分变动性。我们使用多评委人类判断对 Qwen2-Audio-7B-Instruct 模型进行微调,并开发了基于共轭校准的不确定性校准回归方法,以实现可解释的置信区间。我们的高斯不确定性建模和共轭校准方法实现了与人类评分的最强匹配,优于回归和分类基线。该模型可靠地评估流畅性和韵律,同时凸显评估准确性的固有难度。综上,这些结果表明,Rubric-Guided、不确定性校准的推理为基于 SpeechLLM 的语音评估提供了一条可信赖且可解释的原则路径。
引用
@article{arxiv.2603.16889,
title = {Rubric-Guided Fine-tuning of SpeechLLMs for Multi-Aspect, Multi-Rater L2 Reading-Speech Assessment},
author = {Aditya Kamlesh Parikh and Cristian Tejedor-Garcia and Catia Cucchiarini and Helmer Strik},
journal= {arXiv preprint arXiv:2603.16889},
year = {2026}
}
备注
Accepted to LREC 2026. This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants, which is financed by the Dutch Research Council (NWO)