中文

一种用于发音错误检测的有效端到端建模方法

音频与语音处理 2020-05-19 v1 计算与语言 声音

摘要

近年来,与传统的混合 DNN-HMM 语音识别系统相比,端到端(E2E)自动语音识别(ASR)系统因其巨大成功和统一的建模范式而备受瞩目。尽管 E2E 建模框架在 ASR 领域已被广泛采用,但针对计算机辅助发音学习(CAPT),尤其是发音错误检测(MD)的 E2E 框架研究仍然匮乏。为此,我们首先提出将混合 CTC-Attention 方法应用于 MD 任务,利用 CTC 和基于注意力模型的优势,同时避免对音素级强制对齐的需求。其次,我们利用文本提示信息进行输入增强,使生成的 E2E 模型更契合 MD 任务。另一方面,我们采用两种 MD 决策方法以更好地配合所提出的框架:1)基于识别置信度测量的决策;2)直接基于语音识别结果的决策。一系列普通话 MD 实验表明,我们的方法不仅简化了现有混合 DNN-HMM 系统的处理流程,还带来了系统且显著的性能提升。此外,利用文本提示的输入增强对于基于 E2E 的 MD 方法似乎展现出极大的潜力。

关键词

引用

@article{arxiv.2005.08440,
  title  = {An Effective End-to-End Modeling Approach for Mispronunciation Detection},
  author = {Tien-Hong Lo and Shi-Yan Weng and Hsiu-Jui Chang and Berlin Chen},
  journal= {arXiv preprint arXiv:2005.08440},
  year   = {2020}
}

备注

Submitted to Interspeech 2020