基于CTC-ATT混合方法的L2英语学习者错音检测系统改进
声音
2022-01-26 v1 音频与语音处理
摘要
本报告提出了计算机辅助语言学习(CALL)领域的前沿研究。错音检测是计算机辅助发音训练(CAPT)系统的核心组成部分之一,而CAPT是CALL的一个子集。自动化发音错误检测的研究始于20世纪90年代,但由于计算能力的提升以及可用于录制发音分析所需语音的移动设备的普及,完整CAPT的发展仅在近十年才加速。检测发音错误是一个难以解决的问题,因为正确与错误发音没有形式化定义。因此,通常检测韵律与音素错误,例如音素替换、插入和删除。此外,学界已达成共识:发音学习应关注说话者可懂度,而非听起来像英语母语(L1)说话者。最初,基于后验似然的方法使用高斯混合模型-隐马尔可夫模型与深度神经网络-隐马尔可夫模型方法开发称为发音优度(Good of Pronunciation)的系统。与近期提出的基于ASR的端到端错音检测系统相比,这些系统实现复杂。本研究的目的是利用连接主义时序分类(CTC)与基于注意力的序列解码器创建端到端(E2E)模型。近来,E2E模型在错音检测准确率上显示出显著提升。本研究将在基线模型CNN-RNN-CTC、带基于字符序列注意力解码器的CNN-RNN-CTC,以及带基于音素解码器的CNN-RNN-CTC系统之间进行比较。本研究将有助于我们确定开发高效错音检测系统的更优方法。
引用
@article{arxiv.2201.10198,
title = {Improved Mispronunciation detection system using a hybrid CTC-ATT based approach for L2 English speakers},
author = {Neha Baranwal and Sharatkumar Chilaka},
journal= {arXiv preprint arXiv:2201.10198},
year = {2022}
}