中文

面向构音障碍语音的自动语音识别模型设备上个性化

音频与语音处理 2021-06-21 v1 计算与语言 机器学习 声音

摘要

虽然当前最先进的自动语音识别(ASR)系统在典型语音上达到高准确率,但其在构音障碍语音及其他非典型语音模式上遭受显著的性能退化。ASR模型的个性化作为该问题的常用解决方案,通常在基于服务器的训练环境中执行,带来了数据隐私、模型更新延迟以及在移动设备与服务器基础设施间拷贝数据和模型的通信成本等问题。本文提出一种基于设备的ASR个性化方法,仅需极少量说话人特定数据。我们在一组100名构音障碍语音说话人的多样集合上测试该方法,发现每名说话人仅需50条短语音即可获得71%的中位相对词错误率改善。在声控家庭自动化平台上测试时,设备上个性化模型展现出81%的中位任务成功率,而未自适应模型仅40%。

关键词

引用

@article{arxiv.2106.10259,
  title  = {On-Device Personalization of Automatic Speech Recognition Models for Disordered Speech},
  author = {Katrin Tomanek and Françoise Beaufays and Julie Cattiau and Angad Chandorkar and Khe Chai Sim},
  journal= {arXiv preprint arXiv:2106.10259},
  year   = {2021}
}