中文

JOIST:一种用于 ASR 的语音与文本联合流式模型

计算与语言 2022-10-17 v1 声音 音频与语音处理

摘要

我们提出 JOIST,一种训练流式、级联、编码器端到端(E2E)模型的算法,该模型同时使用语音-文本配对输入以及仅文本的非配对输入。与以往工作不同,我们探索两种模态的联合训练,而非预训练与微调。此外,我们使用数据量多出一个数量级的流式 E2E 模型来探索 JOIST,这也是相较于以往工作的新颖之处。通过一系列消融研究,我们探索了不同类型的文本建模,包括如何对文本序列的长度进行建模以及合适的文本子词单元表示。我们发现,与未使用文本训练的模型相比,JOIST 的最佳文本表示在各种搜索和罕见词测试集上将 WER 相对降低了 4-14%。此外,我们定量地表明 JOIST 保持了流式能力,这对于良好的用户体验至关重要。

关键词

引用

@article{arxiv.2210.07353,
  title  = {JOIST: A Joint Speech and Text Streaming Model For ASR},
  author = {Tara N. Sainath and Rohit Prabhavalkar and Ankur Bapna and Yu Zhang and Zhouyuan Huo and Zhehuai Chen and Bo Li and Weiran Wang and Trevor Strohman},
  journal= {arXiv preprint arXiv:2210.07353},
  year   = {2022}
}