中文

NTNU系统在2025年S&I挑战SLA开放轨道赛中的表现

计算与语言 2025-09-12 v2 声音 音频与语音处理

摘要

近期研究探索了利用语音语言评估(SLA)中采用神经模型如BERT和wav2vec 2.0(W2V)来评估口语技能的跨语言和声学模态方法。尽管两种模型在捕获口语能力相关特征方面都有效,但各自存在模态特定的局限性。BERT-based方法依赖语音识别转录文本,这些文本往往难以捕获语音韵律和音素线索。相比之下,W2V-based方法在建模声学特征方面表现出色,但缺乏语义可解释性。为克服这些局限性,我们提出了一种将W2V与Phi-4多模态大语言模型(MLLM)集成的系统,通过得分融合策略实现整合。该系统在Speak & Improve Challenge 2025官方测试集上实现了根均方误差(RMSE)为0.375,获得了赛事中第二名的成绩。与之比较,最高名次、第三名以及官方基线系统的RMSE分别为0.364、0.384和0.444。

关键词

引用

@article{arxiv.2506.05121,
  title  = {The NTNU System at the S&I Challenge 2025 SLA Open Track},
  author = {Hong-Yun Lin and Tien-Hong Lo and Yu-Hsuan Fang and Jhen-Ke Lin and Chung-Chun Wang and Hao-Chien Lu and Berlin Chen},
  journal= {arXiv preprint arXiv:2506.05121},
  year   = {2025}
}

备注

submitted to the ISCA SLaTE-2025 Workshop