基于非自回归解码的流式 RNN-Transducer 审慎修正
计算与语言
2021-12-22 v1 机器学习
音频与语音处理
摘要
我们提出利用先前提出的 Align-Refine 非自回归解码方法及其改进版本,对流式 RNN-T 模型的假设对齐进行审慎修正。该方法执行若干细化步骤,每步共享一个 transformer 解码器,该解码器同时关注文本特征(从对齐中提取)与音频特征,并输出完整的更新对齐。该 transformer 解码器使用 CTC 损失进行训练,以便于并行贪心解码,并执行全上下文注意力以捕捉标签依赖关系。我们通过引入级联编码器(在细化前捕捉更多音频上下文)和对齐增强(强制学习标签依赖)来改进 Align-Refine。我们表明,在以流式 RNN-T 模型的假设对齐为条件下,我们的方法比第一遍 RNN-T 获得显著更精确的识别结果,且仅需少量模型参数。
引用
@article{arxiv.2112.11442,
title = {Deliberation of Streaming RNN-Transducer by Non-autoregressive Decoding},
author = {Weiran Wang and Ke Hu and Tara Sainath},
journal= {arXiv preprint arXiv:2112.11442},
year = {2021}
}