中文

黑盒自适应:面向带口音语音的 ASR 适配

音频与语音处理 2020-06-25 v1 计算与语言 声音

摘要

我们提出将黑盒、基于云的 ASR 系统适配到来自目标口音语音的问题。尽管领先的在线 ASR 服务在主流口音上取得了令人印象深刻的性能,它们在子群体上表现不佳——我们观察到 Google 的 ASR API 在印度口音上的词错误率(WER)几乎是美式口音上的两倍。现有的适配方法要么需要访问模型参数,要么在输出转录文本上叠加一个纠错模块。我们强调需要将输出与原始语音相关联以修正口音错误。据此,我们提出一种将开源的口音调优本地模型与该黑盒服务相耦合的新方法,其中来自服务的输出引导本地模型中的帧级推断。我们的细粒度合并算法比现有的词级组合策略更擅长修正口音错误。以三个领先 ASR 模型作为服务,在印度与澳大利亚口音上的实验表明,相较本地与服务模型,我们的方法实现了多达 28% 的 WER 相对降低。

关键词

引用

@article{arxiv.2006.13519,
  title  = {Black-box Adaptation of ASR for Accented Speech},
  author = {Kartik Khandelwal and Preethi Jyothi and Abhijeet Awasthi and Sunita Sarawagi},
  journal= {arXiv preprint arXiv:2006.13519},
  year   = {2020}
}

备注

A slightly different version submitted to INTERSPEECH 2020 (currently under review)