基于分块注意力的编解码器模型用于流式语音识别
音频与语音处理
2024-01-18 v2 声音
机器学习
摘要
我们研究了一种可流式处理的基于注意力的编解码器模型,其中解码器或编码器与解码器二者都在称为块(chunk)的预定义固定大小窗口上操作。一个特殊的块结束(EOC)符号从一个块推进到下一个块,有效地替代了传统的序列结束符号。这一修改虽小,却使我们的模型等价于在块而非帧上操作的转导器(transducer)模型,其中 EOC 对应于空白符号。我们进一步探讨了标准转导器与我们的模型之间的其余差异。此外,我们考察了相关方面,如长语音泛化、束搜索大小和长度归一化。通过在 Librispeech 和 TED-LIUM-v2 上的实验,并通过拼接连续序列进行长语音试验,我们发现我们的可流式模型相比非流式变体保持了有竞争力的性能,并且对长语音泛化非常好。
关键词
引用
@article{arxiv.2309.08436,
title = {Chunked Attention-based Encoder-Decoder Model for Streaming Speech Recognition},
author = {Mohammad Zeineldeen and Albert Zeyer and Ralf Schlüter and Hermann Ney},
journal= {arXiv preprint arXiv:2309.08436},
year = {2024}
}
备注
Accepted at ICASSP 2024