基于 Mask-CTC 的编码器预训练用于流式端到端语音识别
声音
2023-09-12 v1 音频与语音处理
摘要
在流式端到端自动语音识别(ASR)系统中,以低延迟实现高精度一直是一项挑战。通过关注更多未来上下文,流式 ASR 模型可实现更高精度,但会导致更大延迟,从而损害流式性能。在 Mask-CTC 框架中,编码器网络被训练以学习预测长期上下文的特征表示,这有利于流式 ASR。基于 Mask-CTC 的编码器预训练已证明有益于为基于触发注意力的 ASR 实现低延迟与高精度。然而,该方法的有效性尚未在不同模型架构上得到验证,也未证实编码器具备预期的用于减少延迟的前瞻能力。因此,本研究考察了基于 Mask-CTC 的预训练对于具有不同架构(如 Transformer-Transducer 与上下文块流式 ASR)模型的有效性。我们还讨论了所提预训练方法对获得准确输出脉冲时序的影响。
引用
@article{arxiv.2309.04654,
title = {Mask-CTC-based Encoder Pre-training for Streaming End-to-End Speech Recognition},
author = {Huaibo Zhao and Yosuke Higuchi and Yusuke Kida and Tetsuji Ogawa and Tetsunori Kobayashi},
journal= {arXiv preprint arXiv:2309.04654},
year = {2023}
}
备注
Accepted to EUSIPCO 2023