中文

采用深度学习自动检测非母语英语语音中的发音错误

音频与语音处理 2022-09-15 v1 声音 其他定量生物学

摘要

尽管近年来取得显著进展,现有计算机辅助发音训练(CAPT)方法检测发音错误的精度仍相对较低(在 40%–80% 召回率下精度为 60%)。本博士工作提出用于检测非母语(L2)英语语音中发音错误的新型深度学习方法,在 AUC 指标(曲线下面积)上超越最先进方法 41%,即从 0.528 提升至 0.749。现有 CAPT 方法的问题之一是可靠训练发音错误检测模型所需的标注错发音语音可用性低。因此,将发音错误检测重新表述为生成合成错发音语音的任务。直观上,若我们能模拟错发音语音并生成任意数量的训练数据,检测发音错误将更为有效。此外,为消除对齐标准音素与识别音素的需要,提出一种直接检测发音错误的新型端到端多任务技术。该发音错误检测模型已在 Amazon 用于自动检测合成语音中的发音错误,以加速新语音合成方法的研究。结果表明,所提深度学习方法适用于构音障碍语音的检测与重建任务。

关键词

引用

@article{arxiv.2209.06265,
  title  = {Automated detection of pronunciation errors in non-native English speech employing deep learning},
  author = {Daniel Korzekwa},
  journal= {arXiv preprint arXiv:2209.06265},
  year   = {2022}
}

备注

PhD Thesis, in English + extended summary in Polish