中文

TSNAT:用于语音识别的两步非自回归 Transformer 模型

音频与语音处理 2022-04-06 v1 计算与语言

摘要

自回归(AR)模型,如基于注意力的编码器-解码器模型和 RNN-Transducer,已在语音识别中取得巨大成功。它们基于先前词符和声学编码状态预测输出序列,在 GPU 上效率低下。非自回归(NAR)模型可摆脱输出词符间的时间依赖,并在至少一步内预测整个输出词符。然而,NAR 模型仍面临两个主要问题。一方面,NAR 模型与先进 AR 模型之间仍存在较大性能差距。另一方面,大多数 NAR 模型难以训练与收敛。为解决这两个问题,我们提出一种名为两步非自回归 Transformer(TSNAT)的新模型,其通过从参数共享的 AR 模型学习先验知识来提升 NAR 模型的性能并加速其收敛。此外,我们将两阶段方法引入推理过程,大幅提升了模型性能。所有实验均在公开中文普通话数据集 AISHELL-1 上进行。结果表明,TSNAT 可达到与 AR 模型相竞争的性能,并优于许多复杂的 NAR 模型。

关键词

引用

@article{arxiv.2104.01522,
  title  = {TSNAT: Two-Step Non-Autoregressvie Transformer Models for Speech Recognition},
  author = {Zhengkun Tian and Jiangyan Yi and Jianhua Tao and Ye Bai and Shuai Zhang and Zhengqi Wen and Xuefei Liu},
  journal= {arXiv preprint arXiv:2104.01522},
  year   = {2022}
}

备注

Submitted to Interspeech2021