具有随机未来上下文的多模式 Transformer Transducer
音频与语音处理
2021-06-21 v1 计算与语言
声音
摘要
当提供更多周围语音信息作为上下文时,自动语音识别(ASR)模型的错误更少。遗憾的是,获取更大的未来上下文会导致更高的延迟。速度与准确率之间存在不可避免的权衡。朴素地看,为适配不同的延迟要求,人们不得不存储多个模型并在约束下挑选最优的一个。相反,更理想的方法是拥有单一模型,能根据不同约束动态调整其延迟,我们称之为多模式 ASR。多模式 ASR 模型可在推理阶段满足各种延迟要求——当可接受较大延迟时,模型可处理更长的未来上下文以获得更高准确率;当延迟预算不灵活时,模型可较少依赖未来上下文但仍保持可靠准确率。为实现多模式 ASR,我们提出 Stochastic Future Context,一种在每次迭代中采样一种流式配置的简单训练流程。通过在 AISHELL-1 和 LibriSpeech 数据集上的大量实验,我们表明多模式 ASR 模型可媲美(甚至超越)一组以不同延迟预算训练的竞争性流式基线。
引用
@article{arxiv.2106.09760,
title = {Multi-mode Transformer Transducer with Stochastic Future Context},
author = {Kwangyoun Kim and Felix Wu and Prashant Sridhar and Kyu J. Han and Shinji Watanabe},
journal= {arXiv preprint arXiv:2106.09760},
year = {2021}
}
备注
Accepted to Interspeech 2021