中文

基于原始波形的端到端误发音检测与诊断

音频与语音处理 2021-06-02 v4 多媒体 声音

摘要

误发音检测与诊断(MDD)旨在识别发音错误并提供指导性反馈以引导非母语语言学习者,是计算机辅助发音训练(CAPT)系统的核心组成部分。然而,由于收集非母语数据及其标注耗时费力,MDD常受数据稀疏问题困扰。为解决此问题,我们探索了一种用于MDD的完全端到端(E2E)神经模型,该模型直接基于原始波形处理学习者的语音。与传统的手工声学特征相比,原始波形保留了更多声学现象,并有可能帮助神经网络发现更好且更定制化的表示。为此,我们的MDD模型采用所谓的SincNet模块接收原始波形输入并将其转换为合适的向量表示序列。SincNet利用基正弦函数(sinc)实现可学习的带通滤波器,其灵感来自卷积神经网络(CNN)。与CNN相比,SincNet参数更少且更易于人工解释。我们在L2-ARCTIC数据集上进行了大量实验,该数据集是为CAPT研究编译的公开非母语英语语音语料库。我们发现SincNet的sinc滤波器可针对不同国籍的非母语语言学习者快速适配。此外,我们的模型在误发音检测性能上可与最先进的以标准手工声学特征为输入的E2E MDD模型相媲美。除此之外,我们的模型在音素错误率(PER)和诊断准确率上也取得了可观的提升。

关键词

引用

@article{arxiv.2103.03023,
  title  = {End-to-End Mispronunciation Detection and Diagnosis From Raw Waveforms},
  author = {Bi-Cheng Yan and Berlin Chen},
  journal= {arXiv preprint arXiv:2103.03023},
  year   = {2021}
}

备注

Preprint. Under review 5 pages, 3 figures