中文

基于 CTC 对齐的非自回归 Transformer 用于端到端自动语音识别

计算与语言 2023-04-18 v1 音频与语音处理

摘要

近年来,端到端模型已被广泛用于自动语音识别(ASR)系统。最具代表性的两类方法是连接主义时序分类(CTC)与基于注意力的编码器-解码器(AED)模型。自回归 Transformer 作为 AED 的变体,采用自回归机制生成词元,因而推理相对较慢。本文对用于端到端 ASR 的基于 CTC 对齐的单步非自回归 Transformer(CASS-NAT)进行了全面研究。在 CASS-NAT 中,自回归 Transformer(AT)中的词嵌入被令牌级声学嵌入(TAE)替代,后者由编码器输出结合 CTC 对齐提供的声学边界信息提取得到。TAE 可并行获取,从而实现输出词元的并行生成。训练期间,使用 Viterbi 对齐生成 TAE,并进一步探索多种训练策略以改善词错误率(WER)表现。推理期间,深入研究了基于误差的对齐采样方法,以减少训练与测试过程中的对齐失配。实验结果表明,CASS-NAT 在各种 ASR 任务上的 WER 接近 AT,同时提供约 24 倍的推理加速。无论有无自监督学习,我们均在多个数据集上取得了非自回归模型的新最优(state-of-the-art)结果。我们还分析了 CASS-NAT 解码器的行为,以解释其为何能表现与 AT 相近。我们发现 TAE 对语法结构具有与词嵌入相似的功能,这可能表明无需语言模型即可从 TAE 中学习某些语义信息的可能性。

关键词

引用

@article{arxiv.2304.07611,
  title  = {A CTC Alignment-based Non-autoregressive Transformer for End-to-end Automatic Speech Recognition},
  author = {Ruchao Fan and Wei Chu and Peng Chang and Abeer Alwan},
  journal= {arXiv preprint arXiv:2304.07611},
  year   = {2023}
}

备注

Published in IEEE Transactions on Audio, Speech, and Language Processing