面向非自回归 Transformer 混合语言语音识别的最小词错训练
音频与语音处理
2021-10-08 v1
摘要
非自回归端到端 ASR 框架因其当前输出词元独立于历史词元的固有特性,可能天然适用于混合语言(code-switching)识别任务。然而,其性能仍落后于最先进的自回归 ASR 框架。本文中,我们提出多种方法来提升基于 CTC-mask 的非自回归 Transformer 在混合语言 ASR 场景下的表现。首先,我们尝试与混合语言点紧密相关的多样化掩码方法,从而得到改进的基线模型。更重要的是,我们采用最小词错(MWE)准则训练模型。其中的挑战之一是如何生成多样化的假设空间,以对给定真值获得平均损失。为解决该挑战,我们探索了不同方法来生成所需的基于 N-best 的假设空间。我们在 SEAME 语料库(一个面向东南亚社群的极具挑战性的英中混合语言语料库)上验证了所提方法的有效性。与基于交叉熵训练的强基线相比,所提 MWE 训练方法在测试集上取得了持续的性能提升。
引用
@article{arxiv.2110.03573,
title = {Minimum word error training for non-autoregressive Transformer-based code-switching ASR},
author = {Yizhou Peng and Jicheng Zhang and Haihua Xu and Hao Huang and Eng Siong Chng},
journal= {arXiv preprint arXiv:2110.03573},
year = {2021}
}
备注
Submit to ICASSP 2021