基于 Transformer 因果模型利用编码器状态修正策略改进流式端到端 ASR
音频与语音处理
2022-07-07 v1 声音
摘要
在流式自动语音识别(ASR)中,性能与延迟之间往往存在权衡。传统方法如前瞻和基于分块的方法通常需要来自未来帧的信息以提升识别准确率,即使计算足够快也会带来不可避免的延迟。完全不依赖任何未来帧进行计算的因果模型可避免此延迟,但其性能显著劣于传统方法。本文提出相应的修正策略以改进因果模型。首先,我们引入实时编码器状态修正策略来修改先前的状态。编码器在前向计算一旦接收到数据即开始,并在若干帧后修正先前的编码器状态,无需等待任何右上下文。此外,设计了一种 CTC 尖峰位置对齐解码算法以降低修正策略带来的时间开销。实验均在 Librispeech 数据集上进行。基于 CTC 的 wav2vec2.0 模型微调后,我们的最佳方法在 test-clean/other 集上可达到 3.7/9.2 的词错率(WER),且与基于分块的方法和知识蒸馏方法具有竞争力。
引用
@article{arxiv.2207.02495,
title = {Improving Streaming End-to-End ASR on Transformer-based Causal Models with Encoder States Revision Strategies},
author = {Zehan Li and Haoran Miao and Keqi Deng and Gaofeng Cheng and Sanli Tian and Ta Li and Yonghong Yan},
journal= {arXiv preprint arXiv:2207.02495},
year = {2022}
}
备注
Accepted by Interspeech 2022