中文

无需音素时间对齐的发音质量评估

计算与语言 2026-03-27 v1 人工智能 人机交互 机器学习

摘要

在语音评估中,自动语音识别(ASR)模型通常会为输入特征计算时间边界和音素后验概率。然而,受限的ASR训练数据限制了语音评估向低资源语言的扩展。开源的弱监督模型能够覆盖多种语言,但它们是帧级异步且非音素化的,这会阻碍语音评估的特征提取。本文提出了一种方法,克服了与弱监督模型之间的不兼容性,从而简化了向低资源语言扩展语音评估的过程。通过将ASR假设映射到音素混淆网络来计算音素后验概率。采用词而非音素的层级 speaking rate 和 duration。通过交叉注意力架构组合音素和帧级特征,无需音素时间对齐。该方法在英文 speechocean762 和低资源泰米尔语数据集上,与标准帧同步特征的性能相当。

关键词

引用

@article{arxiv.2603.25150,
  title  = {Goodness-of-pronunciation without phoneme time alignment},
  author = {Jeremy H. M. Wong and Nancy F. Chen},
  journal= {arXiv preprint arXiv:2603.25150},
  year   = {2026}
}