面向非自回归端到端 ASR 的改进 Mask-CTC
音频与语音处理
2021-02-17 v2 计算与语言
声音
摘要
对于自动语音识别(ASR)的实际部署,系统需具备快速推理能力,同时降低对计算资源的需求。近期提出的基于带连接时序分类(CTC)的掩码预测、以非自回归方式生成词符的端到端 ASR 系统 Mask-CTC 满足了这一需求。尽管 Mask-CTC 实现了极快的推理速度,其识别性能仍落后于传统的自回归(AR)系统。为提升 Mask-CTC 的性能,我们首先提出采用一种近期提出的称为 Conformer 的架构来增强编码器网络结构。接着,我们提出新的训练与解码方法,引入辅助目标以预测部分目标序列的长度,使模型在推理时可删除或插入词符。在不同 ASR 任务上的实验结果表明,所提方法显著改进了 Mask-CTC,优于标准 CTC 模型(WSJ 上 WER 由 15.5% 降至 9.1%)。此外,Mask-CTC 现已取得与 AR 模型相当的结果,且推理速度无退化(使用 CPU 时 RTF < 0.1)。我们还展示了 Mask-CTC 在端到端语音翻译中的潜在应用。
引用
@article{arxiv.2010.13270,
title = {Improved Mask-CTC for Non-Autoregressive End-to-End ASR},
author = {Yosuke Higuchi and Hirofumi Inaguma and Shinji Watanabe and Tetsuji Ogawa and Tetsunori Kobayashi},
journal= {arXiv preprint arXiv:2010.13270},
year = {2021}
}
备注
Accepted to ICASSP2021