用于流式 Transformer 语音识别的自正则化最小延迟训练
音频与语音处理
2023-04-25 v1 声音
摘要
本文提出了一种用于基于流式 Transformer 的自动语音识别(ASR)系统的自正则化最小延迟训练(SR-MLT)方法。在先前的工作中,延迟是通过基于传统 ASR 模型获得的硬对齐来截断在线注意力权重来优化的,而没有考虑 ASR 精度潜在的损失。相反,我们在此提出一种策略,将对齐作为模型训练的一部分在无外部监督的情况下获得。所提方法产生的对齐在训练数据上被动态正则化,从而使得延迟的降低不会导致 ASR 精度的损失。SR-MLT 作为微调步骤应用于基于单调分块注意力(MoChA)或累积注意力(CA)算法进行在线解码的预训练 Transformer 模型。在 AIShell-1 和 Librispeech 数据集上的 ASR 实验表明,当应用于一个良好的预训练 MoChA 或 CA 基线模型时,SR-MLT 能有效降低延迟,相对增益在 11.8% 到 39.5% 之间。此外,我们还证明,在特定精度水平下,使用 SR-MLT 训练的模型相比使用外部硬对齐监督的模型能够实现更低的延迟。
引用
@article{arxiv.2304.11985,
title = {Self-regularised Minimum Latency Training for Streaming Transformer-based Speech Recognition},
author = {Mohan Li and Rama Doddipatla and Catalin Zorila},
journal= {arXiv preprint arXiv:2304.11985},
year = {2023}
}
备注
5 pages, 2 figures, accepted at Interspeech2022