无需音素时间对齐的发音质量评估
计算与语言
2026-03-27 v1 人工智能
人机交互
机器学习
摘要
在语音评估中,自动语音识别(ASR)模型通常会为输入特征计算时间边界和音素后验概率。然而,受限的ASR训练数据限制了语音评估向低资源语言的扩展。开源的弱监督模型能够覆盖多种语言,但它们是帧级异步且非音素化的,这会阻碍语音评估的特征提取。本文提出了一种方法,克服了与弱监督模型之间的不兼容性,从而简化了向低资源语言扩展语音评估的过程。通过将ASR假设映射到音素混淆网络来计算音素后验概率。采用词而非音素的层级 speaking rate 和 duration。通过交叉注意力架构组合音素和帧级特征,无需音素时间对齐。该方法在英文 speechocean762 和低资源泰米尔语数据集上,与标准帧同步特征的性能相当。
引用
@article{arxiv.2603.25150,
title = {Goodness-of-pronunciation without phoneme time alignment},
author = {Jeremy H. M. Wong and Nancy F. Chen},
journal= {arXiv preprint arXiv:2603.25150},
year = {2026}
}