中文

一种全新自动化语音评估方法

计算与语言 2025-10-07 v1 音频与语音处理

摘要

我们提出一种高效的面向多部分第二语言测试的整体自动语音评估(ASA)方法,为 2025 年 Speak & Improve 挑战赛开发。该系统的核心创新在于仅用单个 Whisper-small 编码器处理所有四段口语响应,通过轻量级聚合器组合所有信息并预测最终得分。该架构消除了转录和逐部分模型的需求,显著缩短推理时间,使 ASA 在大规模计算机辅助语言学习系统中具有实际应用价值。我们的方法实现的均方根误差(RMSE)为 0.384,优于基于文本的基线模型(0.44),且参数数量最多为 1.68 亿(约为 Whisper-small 的 70%)。此外,我们提出一种数据抽样策略,使模型仅在语料库中 44.8% 的说话者上训练即可达到 0.383 的 RMSE,展示了在不平衡类别上的优异性能和强大的数据效率。

关键词

引用

@article{arxiv.2507.17918,
  title  = {One Whisper to Grade Them All},
  author = {Nhan Phan and Anusha Porwal and Yaroslav Getman and Ekaterina Voskoboinik and Tamás Grósz and Mikko Kurimo},
  journal= {arXiv preprint arXiv:2507.17918},
  year   = {2025}
}

备注

Accepted to SLaTE 2025 workshop