中文

一种基于审议机制的声学-文本联合解码器

音频与语音处理 2023-03-28 v1 计算与语言 机器学习 声音

摘要

我们提出一种新的两遍端到端(E2E)语音识别模型,通过对配对数据与未配对文本数据的组合进行训练来提升 ASR 性能。此前,联合声学与文本解码器(JATD)通过在模型训练中使用文本数据已展现出有前景的结果,且近期引入的审议(deliberation)架构通过利用第一遍解码结果降低了识别错误。我们的方法称为 Deliberation-JATD,将审议的拼写纠正能力与 JATD 对未配对文本数据的利用相结合,以进一步提升性能。所提模型在多个测试集上取得显著增益,尤其在聚焦于罕见词的测试集上,其词错误率(WER)相对降低了 12% 至 22.5%。这在不增大模型规模或无需多阶段训练的情况下实现,使 Deliberation-JATD 成为端侧应用的高效候选方案。

关键词

引用

@article{arxiv.2303.15293,
  title  = {A Deliberation-based Joint Acoustic and Text Decoder},
  author = {Sepand Mavandadi and Tara N. Sainath and Ke Hu and Zelin Wu},
  journal= {arXiv preprint arXiv:2303.15293},
  year   = {2023}
}

备注

Interspeech 2021