统一流式与非流式基于 Zipformer 的自动语音识别
声音
2025-06-18 v1 人工智能
音频与语音处理
摘要
随着对统一开发、训练和部署成本以降低而日益增加的关注,统一流式与非流式自动语音识别(ASR)模型的趋势正在增长。我们提出了一个统一框架,用于训练单个端到端 ASR 模型以适用于流式和非流式应用,利用未来上下文信息。我们提议通过 Zipformer 基于 ASR 模型训练中的分块注意力掩码实现动态右侧上下文。我们演示了在 Zipformer 模型中使用右侧上下文相较于其他 Conformer 模型更为有效,这得益于其多尺度特性。我们分析了不同数量右侧上下文帧对流式 ASR 模型准确率和延迟的影响。我们使用 Librispeech 和大型内部对话数据集训练不同的流式和非流式模型,并在生产级服务器-客户端设置中,对不同领域的多样测试集进行评估。该方法在用户感知延迟轻微下降的情况下,将词错误率降低了约 7.9%。通过增加右侧上下文帧,我们能够实现流式性能接近非流式模型。我们的方案还允许根据客户要求灵活控制延迟-精度之间的权衡。
引用
@article{arxiv.2506.14434,
title = {Unifying Streaming and Non-streaming Zipformer-based ASR},
author = {Bidisha Sharma and Karthik Pandia Durai and Shankar Venkatesan and Jeena J Prakash and Shashi Kumar and Malolan Chetlur and Andreas Stolcke},
journal= {arXiv preprint arXiv:2506.14434},
year = {2025}
}
备注
Accepted in ACL2025 Industry track