一种基于审议机制的声学-文本联合解码器
音频与语音处理
2023-03-28 v1 计算与语言
机器学习
声音
摘要
我们提出一种新的两遍端到端(E2E)语音识别模型,通过对配对数据与未配对文本数据的组合进行训练来提升 ASR 性能。此前,联合声学与文本解码器(JATD)通过在模型训练中使用文本数据已展现出有前景的结果,且近期引入的审议(deliberation)架构通过利用第一遍解码结果降低了识别错误。我们的方法称为 Deliberation-JATD,将审议的拼写纠正能力与 JATD 对未配对文本数据的利用相结合,以进一步提升性能。所提模型在多个测试集上取得显著增益,尤其在聚焦于罕见词的测试集上,其词错误率(WER)相对降低了 12% 至 22.5%。这在不增大模型规模或无需多阶段训练的情况下实现,使 Deliberation-JATD 成为端侧应用的高效候选方案。
引用
@article{arxiv.2303.15293,
title = {A Deliberation-based Joint Acoustic and Text Decoder},
author = {Sepand Mavandadi and Tara N. Sainath and Ke Hu and Zelin Wu},
journal= {arXiv preprint arXiv:2303.15293},
year = {2023}
}
备注
Interspeech 2021