中文

基于自注意力机制与对抗联合训练的鲁棒端到端语音识别

音频与语音处理 2021-04-06 v1

摘要

近来,自注意力机制在自动语音识别(ASR)领域标志着一个新的里程碑。然而,由于系统依据完整输入序列与先前预测来预测下一输出符号,其性能易受环境干扰的影响。受生成对抗网络(GAN)在语音增强与 ASR 任务中广泛应用的启发,我们提出一种结合自注意力机制的对抗联合训练框架,以提升 ASR 系统的噪声鲁棒性。总体上,其由一个自注意力语音增强 GAN 与一个自注意力端到端 ASR 模型组成。该框架有两个值得注意的亮点:其一,它受益于自注意力机制与 GAN 两者的进展;其二,GAN 的判别器在对抗联合训练阶段扮演全局判别网络的角色,引导增强前端为后续 ASR 模块捕捉更兼容的结构,从而弥补分离训练与手工损失函数的局限。借助对抗联合优化,所提框架有望学习到更适于 ASR 任务的鲁棒表示。我们在 AISHELL-1 语料库上进行了系统实验,实验结果表明,在人工加噪测试集上,相较仅用干净数据训练的 ASR 模型,所提框架取得了 66% 的相对提升;相较无联合训练的语音增强与 ASR 方案提升 35.1%;相较多条件训练提升 5.3%。

关键词

引用

@article{arxiv.2104.01471,
  title  = {Adversarial Joint Training with Self-Attention Mechanism for Robust End-to-End Speech Recognition},
  author = {Lujun Li and Yikai Kang and Yuchen Shi and Ludwig Kürzinger and Tobias Watzel and Gerhard Rigoll},
  journal= {arXiv preprint arXiv:2104.01471},
  year   = {2021}
}