中文

通过纯文本与半监督训练改进深思(Deliberation)模型

计算与语言 2022-06-30 v1 声音 音频与语音处理

摘要

基于仅音频数据的纯文本与半监督训练因未标注文本与语音数据的广泛可得性而近年受到青睐。本工作中,我们提出将纯文本与半监督训练引入基于注意力的深思(deliberation)模型。通过在训练中为深思文本编码器训练来自 transformer 的双向编码器表示(BERT)以融入纯文本数据,并利用联合声学与文本解码器(JATD)与半监督训练使用大规模文本转语音与仅音频语句,我们相较于基线深思在各任务上实现了 4%–12% 的 WER 降低。相较于最先进的语言模型(LM)重打分方法,该深思模型将 Google Voice Search 的 WER 相对降低 11%。我们表明,该深思模型在与最先进 LM 重打分器相比时也取得了正向人工并排评估,且具备合理的端点器延迟。

关键词

引用

@article{arxiv.2206.14716,
  title  = {Improving Deliberation by Text-Only and Semi-Supervised Training},
  author = {Ke Hu and Tara N. Sainath and Yanzhang He and Rohit Prabhavalkar and Trevor Strohman and Sepand Mavandadi and Weiran Wang},
  journal= {arXiv preprint arXiv:2206.14716},
  year   = {2022}
}

备注

Accepted by Interspeech 2022