用于端到端语音识别的尖峰触发非自回归 Transformer
音频与语音处理
2020-05-19 v1 计算与语言
声音
摘要
非自回归 transformer 模型在神经机器翻译中已实现极快的推理速度以及与自回归序列到序列模型相当的性能。大多数非自回归 transformer 从预定义长度的掩码序列解码目标序列。若预定义长度过长,将造成大量冗余计算;若预定义长度短于目标序列长度,则会损害模型性能。为解决此问题并提升推理速度,我们提出一种用于端到端语音识别的尖峰触发非自回归 transformer 模型,其引入 CTC 模块来预测目标序列长度并加速收敛。所有实验均在公开中文普通话数据集 AISHELL-1 上进行。结果表明,所提模型能准确预测目标序列长度,并取得与先进 transformer 相当的性能。此外,该模型甚至达到 0.0056 的实时因子,超越所有主流语音识别模型。
引用
@article{arxiv.2005.07903,
title = {Spike-Triggered Non-Autoregressive Transformer for End-to-End Speech Recognition},
author = {Zhengkun Tian and Jiangyan Yi and Jianhua Tao and Ye Bai and Shuai Zhang and Zhengqi Wen},
journal= {arXiv preprint arXiv:2005.07903},
year = {2020}
}
备注
5 pages