中文

利用有限数据对构音障碍与口音语音进行个性化 ASR

计算与语言 2021-05-11 v1 机器学习 声音 音频与语音处理

摘要

自动语音识别(ASR)系统在过去几年中取得了显著改进。ASR 系统最常由“典型”语音训练而来,这意味着代表性不足群体并未体验到同等程度的改进。在本文中,我们提出并评估了用于改善非标准语音用户 ASR 性能的微调技术。我们关注两类非标准语音:肌萎缩侧索硬化症(ALS)患者的语音与口音语音。我们训练的个性化模型在这两类群体上分别实现了 62% 和 35% 的相对词错率(WER)提升,在消息库短语测试集上将 ALS 说话者的绝对 WER 降至轻度构音障碍的 10% 和较严重构音障碍的 20%。我们表明,71% 的改进仅来自 5 分钟的训练数据。微调特定层子集(参数少得多)通常比微调整个模型效果更好。这是构建面向构音障碍语音的先进 ASR 模型的第一步。

关键词

引用

@article{arxiv.1907.13511,
  title  = {Personalizing ASR for Dysarthric and Accented Speech with Limited Data},
  author = {Joel Shor and Dotan Emanuel and Oran Lang and Omry Tuval and Michael Brenner and Julie Cattiau and Fernando Vieira and Maeve McNally and Taylor Charbonneau and Melissa Nollstadt and Avinatan Hassidim and Yossi Matias},
  journal= {arXiv preprint arXiv:1907.13511},
  year   = {2021}
}

备注

5 pages