中文

NOCASA 2025挑战赛的端到端语音评估模型对比

计算与语言 2025-09-04 v1 声音 音频与语音处理

摘要

本文分析了为NOCASA 2025挑战赛开发的三个端到端模型,旨在实现挪威语作为第二语言的儿童自动词级发音评估。我们的模型包括一个编码器-解码器孪生架构(E2E-R)、一个利用预训练wav2vec2.0表示的前缀调优直接分类模型,以及一个通过CTC计算无对齐发音优良度(GOP)特征的新型模型。我们引入了一种加权序数交叉熵损失,用于优化无加权平均召回率和平均绝对误差等指标。在所探索的方法中,基于GOP-CTC的模型取得了最高性能,大幅超越挑战赛基线并获得了排行榜前列分数。

关键词

引用

@article{arxiv.2509.03256,
  title  = {Comparison of End-to-end Speech Assessment Models for the NOCASA 2025 Challenge},
  author = {Aleksei Žavoronkov and Tanel Alumäe},
  journal= {arXiv preprint arXiv:2509.03256},
  year   = {2025}
}

备注

Published at IEEE MLSP 2025