中文

基于音高的 RNN-T 模型用于普通话误音检测与诊断

声音 2024-06-10 v1 计算与语言 音频与语音处理

摘要

误音检测与诊断 (MDD) 系统利用自动语音识别 (ASR) 面临普通话的两个主要挑战:1) 两阶段模型在音素或音调分类阶段和 MDD 阶段之间存在信息差。2) 普通话 MDD 数据集的稀缺限制了模型训练。在本文中,我们引入了一个无状态 RNN-T 模型用于普通话 MDD,利用通过音高融合块融合 HuBERT 特征的音高嵌入。我们的模型仅在母语者数据上训练,在非母语场景下相对于最先进的基线模型在电话错误率上提高 3%,在虚假接受率上提高 7%。

关键词

引用

@article{arxiv.2406.04595,
  title  = {Pitch-Aware RNN-T for Mandarin Chinese Mispronunciation Detection and Diagnosis},
  author = {Xintong Wang and Mingqian Shi and Ye Wang},
  journal= {arXiv preprint arXiv:2406.04595},
  year   = {2024}
}

备注

Accepted at Interspeech 2024