中文

文本感知的端到端误发音检测与诊断

声音 2022-06-16 v1 人工智能 音频与语音处理

摘要

误发音检测与诊断(MDD)技术是计算机辅助发音训练系统(CAPT)的关键组成部分。在评估受限语音发音质量的领域中,给定文本可起到教师的作用。传统方法已充分利用先验文本进行模型构建或提升系统性能,例如强制对齐与扩展识别网络。近来,一些基于端到端的方法尝试将先验文本融入模型训练,并初步显示出有效性。然而,以往研究多考虑应用原始注意力机制融合音频表示与文本表示,未顾及可能的文本–发音不匹配。本文提出一种门控策略,在抑制无关文本信息的同时赋予相关音频特征更高重要性。此外,给定文本转录,我们设计了一种额外的对比损失以缩小音素识别与 MDD 的学习目标间的差距。我们使用两个公开数据集(TIMIT 与 L2-Arctic)进行实验,最佳模型相较基线将 F1 分数从 57.51%57.51\% 提升至 61.75%61.75\%。此外,我们提供了详细分析以阐明门控机制与对比学习对 MDD 的有效性。

关键词

引用

@article{arxiv.2206.07289,
  title  = {Text-Aware End-to-end Mispronunciation Detection and Diagnosis},
  author = {Linkai Peng and Yingming Gao and Binghuai Lin and Dengfeng Ke and Yanlu Xie and Jinsong Zhang},
  journal= {arXiv preprint arXiv:2206.07289},
  year   = {2022}
}

备注

Rejected by Interspeech2022