中文

增强CTC模型用于触发式注意力流式ASR的探究

声音 2021-10-22 v1 机器学习 音频与语音处理

摘要

本文尝试将Mask-CTC与触发式注意力机制相结合,构建一种兼具高性能与低延迟的流式端到端自动语音识别(ASR)系统。触发式注意力机制由CTC尖峰触发进行自回归解码,已被证明在流式ASR中有效。然而,为保持基于CTC输出的对齐估计的高精度(其性能关键所在),解码不可避免地需输入一定的未来信息(即具有较高延迟)。需注意,在流式ASR中,期望能在保持低延迟的同时实现高识别精度。因此,本研究旨在通过向编码器预训练引入能够学习预见未来信息(即可考虑长时上下文)特征表示的Mask-CTC,实现低延迟高精度的流式ASR。使用WSJ数据进行的实验比较表明,所提方法比传统触发式注意力流式ASR系统以更低延迟取得更高精度。

关键词

引用

@article{arxiv.2110.10402,
  title  = {An Investigation of Enhancing CTC Model for Triggered Attention-based Streaming ASR},
  author = {Huaibo Zhao and Yosuke Higuchi and Tetsuji Ogawa and Tetsunori Kobayashi},
  journal= {arXiv preprint arXiv:2110.10402},
  year   = {2021}
}

备注

Accepted to APSIPA 2021