基于快慢编码器的转导模型结合流式审议机制的改进
音频与语音处理
2022-12-16 v1
摘要
本文提出了一种用于端到端自动语音识别的、结合流式审议(streaming deliberation)机制的快慢编码器转导模型。我们的目标是在保持低延迟的同时,通过集成流式审议模型来提高快慢编码器转导模型的识别准确率。具体而言,审议模型利用来自流式快速编码器的部分假设,并隐式学习纠正识别错误。我们修改了快慢编码器转导模型的并行束搜索算法,使其高效且与审议模型兼容。此外,审议模型被设计为可处理流式数据。为了进一步提升审议性能,我们探索了一种简单的文本增强方法。我们还比较了用于编码部分假设的 LSTM 和 Conformer 模型。在 Librispeech 和内部数据上的实验表明,与快慢编码器转导模型相比,词错率相对降低(WERR)达 3% 至 5%,模型规模略有增加,额外的 token 发射延迟可忽略不计。与原始神经转导模型相比,所提出的审议模型结合快慢编码器转导模型在 Librispeech 上取得了 10%–11% 的相对词错率降低,在内部数据上取得约 6% 的相对词错率降低,且发射延迟更小。
引用
@article{arxiv.2212.07650,
title = {Improving Fast-slow Encoder based Transducer with Streaming Deliberation},
author = {Ke Li and Jay Mahadeokar and Jinxi Guo and Yangyang Shi and Gil Keren and Ozlem Kalinli and Michael L. Seltzer and Duc Le},
journal= {arXiv preprint arXiv:2212.07650},
year = {2022}
}
备注
Submitted to ICASSP 2023