在线混合 CTC/注意力端到端自动语音识别架构
音频与语音处理
2023-07-06 v1
摘要
近来,端到端自动语音识别(ASR)架构取得日益显著的进展,其无需任何预训练对齐即可将语音转写为文本。一种流行的端到端方法是基于混合连接时序分类(CTC)与注意力(CTC/attention)的 ASR 架构。然而,如何部署混合 CTC/注意力系统用于在线语音识别仍是一个非平凡问题。本文描述我们提出的在线混合 CTC/注意力端到端 ASR 架构,其将传统 CTC/注意力 ASR 架构的所有离线组件替换为相应的流式组件。首先,我们提出稳定单调分块注意力(sMoChA)以将传统全局注意力流式化,并进一步提出单调截断注意力(MTA)以简化 sMoChA 并解决 sMoChA 的训练-解码失配问题。其次,我们提出截断 CTC(T-CTC)前缀得分以流式化 CTC 前缀得分计算。第三,我们设计动态等待联合解码(DWJD)算法以在线方式动态收集 CTC 与注意力的预测。最后,我们使用延迟控制双向长短期记忆(LC-BLSTM)将广泛使用的离线双向编码器网络流式化。在 LibriSpeech 英文与 HKUST 普通话任务上的实验表明,与离线 CTC/注意力模型相比,我们提出的在线 CTC/注意力模型改善了人机交互服务中的实时因子,并以适度退化为代价维持了其性能。据我们所知,这是首个为 CTC/注意力端到端 ASR 架构提供全栈在线方案的 work。
引用
@article{arxiv.2307.02351,
title = {Online Hybrid CTC/Attention End-to-End Automatic Speech Recognition Architecture},
author = {Haoran Miao and Gaofeng Cheng and Pengyuan Zhang and Yonghong Yan},
journal= {arXiv preprint arXiv:2307.02351},
year = {2023}
}