中文

Lego-Features:面向流式与斟酌式 ASR 导出模块化编码器特征

计算与语言 2023-04-04 v1 人工智能 声音 音频与语音处理

摘要

在端到端(E2E)语音识别模型中,编码器与解码器之间不可避免地出现表征紧耦合。我们基于近期已开始探索构建具有模块化编码表征的编码器的工作,使得来自不同模型的编码器与解码器能够以零样本方式拼接,而无需进一步微调。先前研究仅涉及全上下文语音模型,我们则进一步在流式设置中探讨该问题。我们的框架构建于已有编码表征之上,将其转化为模块化特征(称为 Lego-Features),且不需修改预训练模型。当模型以不同初始化重训时,这些特征仍保持可互换性。尽管稀疏,我们表明 Lego-Features 在配合 RNN-T 或 LAS 解码器测试时表现强劲,保持高质量的下游性能。它们也足以在两阶斟酌式解码中表征一阶预测。在此场景下,它们优于 N-best 假设,因为无需辅以声学特征即可给出最佳结果。此外,生成 Lego-Features 不需要束搜索或自回归计算。总体而言,它们为标准编码器输出以及 N-best 假设提供了一种模块化、强劲且廉价的替代方案。

关键词

引用

@article{arxiv.2304.00173,
  title  = {Lego-Features: Exporting modular encoder features for streaming and deliberation ASR},
  author = {Rami Botros and Rohit Prabhavalkar and Johan Schalkwyk and Ciprian Chelba and Tara N. Sainath and Françoise Beaufays},
  journal= {arXiv preprint arXiv:2304.00173},
  year   = {2023}
}