中文

MFLA:用于流式语音识别的单调有限前瞻注意力

计算与语言 2025-06-05 v1 声音 音频与语音处理

摘要

应用Whisper等大型预训练语音模型在降低各种语音任务的训练成本方面显示出前景。然而,将这些模型集成到流式系统中仍然是一个挑战。本文提出了一种新颖的前缀到前缀训练框架,通过微调Whisper实现流式识别。我们引入连续集成-激发机制,在连续语音序列和离散文本标记之间建立准单调对齐。此外,我们设计了单调有限前瞻注意力,使每个标记能够关注语音序列中的无限左上下文和有限右上下文。我们还采用wait-k解码策略以简化解码过程,同时确保训练与测试的一致性。我们的理论分析和实验表明,该方法在延迟和质量之间实现了可控的权衡,使其适用于各种流式应用。

关键词

引用

@article{arxiv.2506.03722,
  title  = {MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition},
  author = {Yinfeng Xia and Huiyan Li and Chenyang Le and Manhong Wang and Yutao Sun and Xingyang Ma and Yanmin Qian},
  journal= {arXiv preprint arXiv:2506.03722},
  year   = {2025}
}

备注

Accepted by Interspeech 2025