增强CTC模型用于触发式注意力流式ASR的探究
声音
2021-10-22 v1 机器学习
音频与语音处理
摘要
本文尝试将Mask-CTC与触发式注意力机制相结合,构建一种兼具高性能与低延迟的流式端到端自动语音识别(ASR)系统。触发式注意力机制由CTC尖峰触发进行自回归解码,已被证明在流式ASR中有效。然而,为保持基于CTC输出的对齐估计的高精度(其性能关键所在),解码不可避免地需输入一定的未来信息(即具有较高延迟)。需注意,在流式ASR中,期望能在保持低延迟的同时实现高识别精度。因此,本研究旨在通过向编码器预训练引入能够学习预见未来信息(即可考虑长时上下文)特征表示的Mask-CTC,实现低延迟高精度的流式ASR。使用WSJ数据进行的实验比较表明,所提方法比传统触发式注意力流式ASR系统以更低延迟取得更高精度。
引用
@article{arxiv.2110.10402,
title = {An Investigation of Enhancing CTC Model for Triggered Attention-based Streaming ASR},
author = {Huaibo Zhao and Yosuke Higuchi and Tetsuji Ogawa and Tetsunori Kobayashi},
journal= {arXiv preprint arXiv:2110.10402},
year = {2021}
}
备注
Accepted to APSIPA 2021