中文

用于在线流式基于注意力语音识别的对齐知识蒸馏

音频与语音处理 2021-08-24 v2 计算与语言 机器学习 声音

摘要

本文描述了一种用于在线流式基于注意力的编码器-解码器(AED)自动语音识别(ASR)系统的高效训练方法。AED 模型通过联合优化所有组件在离线场景中取得了有竞争力的性能。近来它们已通过诸如单调分块注意力(MoChA)等模型扩展到在线流式框架。然而,精细的注意力计算过程对长语音片段不够鲁棒。此外,序列级训练目标和时间受限的流式编码器在推理时导致 token 发射出现不可忽略的延迟。为解决这些问题,我们提出 CTC 同步训练(CTC-ST),其中利用 CTC 对齐作为 token 边界的参考,使 MoChA 模型学习最优单调输入输出对齐。我们制定纯端到端训练目标,将 MoChA 的边界与 CTC 的边界同步。CTC 模型与 MoChA 模型共享编码器以增强编码器表示。此外,所提方法将 CTC 分支中学到的对齐信息提供给基于注意力的解码器。因此,CTC-ST 可视为从 CTC 到 MoChA 的对齐知识自蒸馏。在多种基准数据集上的实验评估表明,所提方法同时显著降低了识别错误和发射延迟。对长语音和噪声语音的鲁棒性也得到了证明。我们将 CTC-ST 与几种从混合 ASR 系统蒸馏对齐知识的方法进行比较,表明 CTC-ST 可在不依赖外部对齐信息的情况下实现准确率和延迟的可比权衡。最佳 MoChA 系统显示出与 RNN-transducer(RNN-T)相当的识别准确率,同时实现了更低的发射延迟。

关键词

引用

@article{arxiv.2103.00422,
  title  = {Alignment Knowledge Distillation for Online Streaming Attention-based Speech Recognition},
  author = {Hirofumi Inaguma and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:2103.00422},
  year   = {2021}
}