中文

面向儿童语音的实时发音错误检测探索

音频与语音处理 2020-03-05 v1 计算与语言 声音

摘要

现代发音错误检测与诊断系统由于深度学习的引入在准确率上取得了显著提升。然而,这些系统尚未针对实时运行能力进行评估,而实时性在为应用提供快速反馈时是一个重要因素。特别是,当前最先进的方法使用双向循环网络,而单向网络可能更为合适。师生学习是改进单向模型的一种自然方法,但在使用 CTC 目标函数时,其受限于输出与证据之间对齐不佳。我们通过尝试两种损失项来改善模型的对齐以解决这一局限。一种损失是“对齐损失”项,它仅在特征不类似于静音时才鼓励输出。另一种损失项使用单向模型作为教师模型来对齐双向模型。我们提出的模型使用这些对齐后的双向模型作为教师模型。在 CSLU 儿童语料库上的实验表明,这些改动降低了输出的延迟,并提高了检测率,但在这两个目标之间存在权衡。

关键词

引用

@article{arxiv.2003.01765,
  title  = {Towards Real-time Mispronunciation Detection in Kids' Speech},
  author = {Peter Plantinga and Eric Fosler-Lussier},
  journal= {arXiv preprint arXiv:2003.01765},
  year   = {2020}
}

备注

6 pages + 1 page for references, accepted at ASRU 2019