中文

CASS-NAT:基于 CTC 对齐的单步非自回归 Transformer 语音识别

音频与语音处理 2021-02-15 v2 计算与语言 声音

摘要

我们提出了一种用于语音识别的基于 CTC 对齐的单步非自回归 Transformer (CASS-NAT)。具体而言,CTC 对齐包含以下信息: 解码器输入的 token 数量, 每个 token 的声学时间跨度。这些信息被用于并行提取每个 token 的声学表示,称为 token 级声学嵌入,它替代了自回归 Transformer (AT) 中的词嵌入,以在解码器中实现并行生成。在推理过程中,提出了一种基于错误的对齐采样方法应用于 CTC 输出空间,在降低 WER 的同时保持了并行性。实验结果表明,在没有外部 LM 的情况下,所提出的方法在 Librispeech test clean/other 数据集上分别实现了 3.8%/9.1% 的 WER,在 Aishell1 普通话语料库上实现了 5.8% 的 CER。与 AT 基线相比,CASS-NAT 在 WER 上有性能下降,但在 RTF 方面快了 51.2 倍。当使用 oracle CTC 对齐进行解码时,无 LM 的 WER 下限在 test-clean 集上达到 2.3%,表明了所提出方法的潜力。

关键词

引用

@article{arxiv.2010.14725,
  title  = {CASS-NAT: CTC Alignment-based Single Step Non-autoregressive Transformer for Speech Recognition},
  author = {Ruchao Fan and Wei Chu and Peng Chang and Jing Xiao},
  journal= {arXiv preprint arXiv:2010.14725},
  year   = {2021}
}

备注

Accepted to ICASSP2021, camera ready version