利用有效增强机制改进端到端误发音检测建模
声音
2021-10-19 v1 人工智能
音频与语音处理
摘要
近来,端到端(E2E)模型因可将二语(L2)学习者语音的谱向量序列作为输入并输出相应音素级序列,在开发误发音检测(MD)系统中吸引了大量研究关注。然而,由于缺乏足够的 L2 说话人标注语音数据用于模型估计,E2E MD 模型相较于基于 DNN-HMM 声学模型构建的传统模型更容易过拟合。为缓解这一关键问题,我们在本文中提出两种建模策略以增强 E2E MD 模型的判别能力,二者分别可隐式利用预训练声学模型中编码的音段特征以及训练数据参考文本中包含的音系特征。第一种是输入增强,旨在从 DNN-HMM 声学模型蒸馏音段判别知识。第二种是标签增强,设法从训练数据文本中捕获更多音系模式。在 L2-ARCTIC 英语数据集上进行的一系列实证实验似乎证实了我们的 E2E MD 模型相较于若干顶尖 E2E MD 模型及基于 DNN-HMM 声学模型构建的经典发音评分方法的有效性。
引用
@article{arxiv.2110.08731,
title = {Improving End-To-End Modeling for Mispronunciation Detection with Effective Augmentation Mechanisms},
author = {Tien-Hong Lo and Yao-Ting Sung and Berlin Chen},
journal= {arXiv preprint arXiv:2110.08731},
year = {2021}
}
备注
7 pages, 2 figures, 4 tables, accepted to Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC 2021)