中文

DTW-SiameseNet:用于误发音检测与纠正的动态时间规整孪生网络

机器学习 2023-03-02 v1 人工智能 音频与语音处理

摘要

个人数字助理(PDA)——如 Siri、Alexa 和 Google Assistant 等——在访问信息和完成跨多个领域、由多样化用户群体执行的任务中扮演着日益重要的角色。文本转语音(TTS)模块使 PDA 能够以自然、类人的方式交互,并在涉及视障或其他残障人士的交互中发挥关键作用。为满足多样化用户的需求,包容性 TTS 对于正确识别和发音不同语言与方言的文本十分重要。尽管语音合成取得了巨大进展,多语言环境下命名实体(NE)的发音准确率仍有很大提升空间。现有的纠正 NE 误发音的方法,如重新训练字素到音素(G2P)模型或维护 TTS 发音词典,需要对真实发音进行昂贵标注,且耗时。本工作中,我们提出了一种高精度、兼容 PDA 的发音学习框架,用于 TTS 误发音检测与纠正任务。此外,我们还提出了一种名为 DTW-SiameseNet 的新型误发音检测模型,该模型采用带有三元组损失的孪生架构进行动态时间规整(DTW)的度量学习。我们证明了一种与区域无关、保护隐私的 TTS 误发音检测解决方案是可行的。我们在真实世界数据集以及由来自 10 个不同地区的参与者录制的匿名人名音频数据集的 NE 发音语料上评估了我们的方法。人工评估表明,与基于音素和基于音频的强基线相比,我们提出的方法平均将发音准确率提高了约 6%。

关键词

引用

@article{arxiv.2303.00171,
  title  = {DTW-SiameseNet: Dynamic Time Warped Siamese Network for Mispronunciation Detection and Correction},
  author = {Raviteja Anantha and Kriti Bhasin and Daniela de la Parra Aguilar and Prabal Vashisht and Becci Williamson and Srinivas Chappidi},
  journal= {arXiv preprint arXiv:2303.00171},
  year   = {2023}
}

备注

Preprint version