DCTX-Conformer:面向低延迟统一流式与非流式 Conformer 语音识别的动态上下文携带机制
音频与语音处理
2024-03-05 v2 人工智能
机器学习
声音
摘要
基于 Conformer 的端到端模型如今已无处不在,并常用于流式与非流式自动语音识别(ASR)中。双模式与动态分块训练等技术有助于统一流式与非流式系统。然而,在具有完整与有限历史上下文的流式识别之间仍存在性能差距。为解决此问题,我们提出在最先进的(SOTA)统一 ASR 系统中集成一种新颖的动态上下文携带机制。我们提出的动态上下文 Conformer(DCTX-Conformer)利用一种非重叠的上下文携带机制,该机制同时考虑分块左上下文以及一个或多个先前的上下文嵌入。我们以相对 25.0% 的词错误率优于 SOTA,且由于额外的上下文嵌入带来的延迟影响可忽略不计。
引用
@article{arxiv.2306.08175,
title = {DCTX-Conformer: Dynamic context carry-over for low latency unified streaming and non-streaming Conformer ASR},
author = {Goeric Huybrechts and Srikanth Ronanki and Xilai Li and Hadis Nosrati and Sravan Bodapati and Katrin Kirchhoff},
journal= {arXiv preprint arXiv:2306.08175},
year = {2024}
}