面向多阶段自动语音识别的部分重写
计算与语言
2023-12-18 v1
摘要
对于许多流式自动语音识别任务,重要的是提供及时的中间流式结果,同时优化高质量最终结果。这可以通过多阶段架构实现,其中一个小型仅左上下文模型创建流式结果,一个较大的左右上下文模型在结束时产生最终结果。虽然这显著提高了最终结果的质量,而不影响系统的流式发射延迟,但流式结果并未受益于质量改进。在这里,我们提出使用一种文本操作算法,该算法合并两个模型的流式输出。我们将流式结果的质量提高了约10%,而不改变最终结果。我们的方法不引入额外延迟,并减少了闪烁。它也是轻量级的,不需要重新训练模型,并且可以应用于各种多阶段架构。
引用
@article{arxiv.2312.09463,
title = {Partial Rewriting for Multi-Stage ASR},
author = {Antoine Bruguier and David Qiu and Yanzhang He},
journal= {arXiv preprint arXiv:2312.09463},
year = {2023}
}