中文

无分割发音优良度

音频与语音处理 2026-02-06 v3 人工智能 计算与语言

摘要

误发音检测与诊断(MDD)是现代计算机辅助语言学习(CALL)系统的重要组成部分。然而,大多数通过发音优良度(GOP)实现音素级 MDD 的系统依赖于将语音预分割为语音单元。这限制了这些方法的准确性,以及使用现代基于 CTC 的声学模型进行评估的可能性。在本研究中,我们首先提出了自对齐 GOP(GOP-SA),使得能够将 CTC 训练的 ASR 模型用于 MDD。接下来,我们定义了一种更通用的无分割方法,该方法考虑了规范转录的所有可能分割(GOP-SF)。我们对 GOP-SF 的定义进行了理论阐述,提出了一种解决潜在数值问题的实现方式,以及一种适当的归一化方法,使得能够使用随时间具有不同峰值锐度的声学模型。我们在 CMU Kids 和 speechocean762 数据集上提供了广泛的实验结果,比较了我们方法的不同定义,估计了 GOP-SF 对声学模型峰值锐度以及目标音素周围上下文数量的依赖性。最后,我们在 speechocean762 数据上将我们的方法与近期研究进行了比较,表明从所提出方法导出的特征向量在音素级发音评估上取得了 SOTA 结果。

关键词

引用

@article{arxiv.2507.16838,
  title  = {Segmentation-free Goodness of Pronunciation},
  author = {Xinwei Cao and Zijian Fan and Torbjørn Svendsen and Giampiero Salvi},
  journal= {arXiv preprint arXiv:2507.16838},
  year   = {2026}
}

备注

The article has been accepted for publication by IEEE TASLPRO