中文

基于 Wav2vec2 动量伪标注改善口音与可懂度评估中的错音检测

音频与语音处理 2022-07-13 v3 计算与语言 机器学习

摘要

当前领先的错音检测与诊断(MDD)系统通过端到端音素识别取得了令人瞩目的性能。此类端到端解决方案的一个挑战是自然 L2 语音上人类标注音素的稀缺性。在本工作中,我们通过伪标注(PL)流程利用未标注的 L2 语音,并扩展了基于预训练自监督学习(SSL)模型的微调方法。具体而言,我们使用 Wav2vec 2.0 作为我们的 SSL 模型,并利用原始标注 L2 语音样本与所创建的伪标注 L2 语音样本对其进行微调。我们的伪标签是动态的,由在线模型即时集成产生,这确保了我们的模型对伪标签噪声具有鲁棒性。我们表明,使用伪标签微调相比仅用标注样本的微调基线实现了 5.35% 的音素错误率降低和 2.48% 的 MDD F1 分数提升。所提出的 PL 方法也被证明优于传统的离线 PL 方法。与最先进的 MDD 系统相比,我们的 MDD 方案产生了更准确且一致的语音错误诊断。此外,我们在一个独立的 UTD-4Accents 数据集上进行了开放测试,基于口音和可懂度,我们系统的识别输出与人类感知表现出强相关性。

关键词

引用

@article{arxiv.2203.15937,
  title  = {Improving Mispronunciation Detection with Wav2vec2-based Momentum Pseudo-Labeling for Accentedness and Intelligibility Assessment},
  author = {Mu Yang and Kevin Hirschi and Stephen D. Looney and Okim Kang and John H. L. Hansen},
  journal= {arXiv preprint arXiv:2203.15937},
  year   = {2022}
}

备注

Accepted to Interspeech 2022