中文

利用自监督语音表示进行错音检测

计算与语言 2023-08-01 v1 声音 音频与语音处理

摘要

近年来,自监督学习(SSL)模型在多种语音处理任务中取得了令人鼓舞的结果,尤其在数据稀缺场景下。本文中,我们研究SSL模型用于二语学习者错音检测任务。我们比较两种下游方法:1)使用母语英语数据训练模型进行音素识别(PR);2)使用非母语英语数据直接为目标任务训练模型。我们比较这些两种方法在各种SSL表示以及从传统基于DNN的语音识别模型提取的表示上的性能。我们在L2Arctic和EpaDB两个在音素级别标注了发音标签的非母语语音数据集上评估模型。总体而言,我们发现使用为目标任务训练的下游模型性能最佳,且大多数上游模型在该任务上表现相近。

关键词

引用

@article{arxiv.2307.16324,
  title  = {Mispronunciation detection using self-supervised speech representations},
  author = {Jazmin Vidal and Pablo Riera and Luciana Ferrer},
  journal= {arXiv preprint arXiv:2307.16324},
  year   = {2023}
}