NTNU系统在2025年S&I挑战SLA开放轨道赛中的表现
计算与语言
2025-09-12 v2 声音
音频与语音处理
摘要
近期研究探索了利用语音语言评估(SLA)中采用神经模型如BERT和wav2vec 2.0(W2V)来评估口语技能的跨语言和声学模态方法。尽管两种模型在捕获口语能力相关特征方面都有效,但各自存在模态特定的局限性。BERT-based方法依赖语音识别转录文本,这些文本往往难以捕获语音韵律和音素线索。相比之下,W2V-based方法在建模声学特征方面表现出色,但缺乏语义可解释性。为克服这些局限性,我们提出了一种将W2V与Phi-4多模态大语言模型(MLLM)集成的系统,通过得分融合策略实现整合。该系统在Speak & Improve Challenge 2025官方测试集上实现了根均方误差(RMSE)为0.375,获得了赛事中第二名的成绩。与之比较,最高名次、第三名以及官方基线系统的RMSE分别为0.364、0.384和0.444。
引用
@article{arxiv.2506.05121,
title = {The NTNU System at the S&I Challenge 2025 SLA Open Track},
author = {Hong-Yun Lin and Tien-Hong Lo and Yu-Hsuan Fang and Jhen-Ke Lin and Chung-Chun Wang and Hao-Chien Lu and Berlin Chen},
journal= {arXiv preprint arXiv:2506.05121},
year = {2025}
}
备注
submitted to the ISCA SLaTE-2025 Workshop