零样本自动发音评估
声音
2023-06-01 v1 计算与语言
机器学习
音频与语音处理
摘要
自动发音评估(APA)对计算机辅助语言学习至关重要。先前的方法依赖标注的语音-文本数据训练自动语音识别(ASR)模型,或依赖语音-分数数据训练回归模型。在本工作中,我们提出一种基于预训练声学模型HuBERT的新型零样本APA方法。我们的方法包括对语音输入进行编码并通过掩码模块对其进行破坏。然后我们采用Transformer编码器并应用k-means聚类以获得令牌序列。最后,设计了一个评分模块来衡量错误恢复的令牌数量。在speechocean762上的实验结果表明,所提方法取得了与有监督回归基线相当的性能,并在皮尔逊相关系数(PCC)方面优于非回归基线。此外,我们分析了掩码策略如何影响APA的性能。
引用
@article{arxiv.2305.19563,
title = {Zero-Shot Automatic Pronunciation Assessment},
author = {Hongfu Liu and Mingqian Shi and Ye Wang},
journal= {arXiv preprint arXiv:2305.19563},
year = {2023}
}
备注
Accepted to Interspeech 2023