中文

Whisfusion:基于扩散 Transformer 的并行语音识别解码

声音 2025-08-12 v1 人工智能 机器学习 音频与语音处理

摘要

快速自动语音识别(ASR)对于实时字幕和会议转录等延迟敏感的应用至关重要。然而,由于自回归(AR)解码器的顺序性质及非自回归(NAR)方法的上下文限制,真正的并行ASR解码仍然具有挑战性。虽然现代ASR编码器一次性可处理最长高30秒的音频,但AR解码器仍按序生成标记,形成延迟瓶颈。我们提出Whisfusion——首个将预训练Whisper编码器与文本扩散解码器融合的框架。该NAR架构通过在每个解码步骤并行处理整个声学上下文,解决AR延迟瓶颈。采用参数高效微调(PEFT)训练的轻量级跨注意力适配器桥接两种模态。我们还引入批处理并行、多步骤解码策略,通过增加候选数量来提升准确率,同时对速度影响最小。仅在LibriSpeech(960小时)上微调的Whisfusion实现的WER低于Whisper-tiny(8.3% vs. 9.7%),在短音频上提供与之相当的延迟。对于时长超过20秒的长音频,速度可较AR基线快达2.6倍,为长形式ASR建立了新的高效运行点。实现代码及训练脚本已公开于https://github.com/taeyoun811/Whisfusion。

关键词

引用

@article{arxiv.2508.07048,
  title  = {Whisfusion: Parallel ASR Decoding via a Diffusion Transformer},
  author = {Taeyoun Kwon and Junhyuk Ahn and Taegeun Yun and Heeju Jwa and Yoonchae Choi and Siwon Park and Nam-Joon Kim and Jangchan Kim and Hyun Gon Ryu and Hyuk-Jae Lee},
  journal= {arXiv preprint arXiv:2508.07048},
  year   = {2025}
}

备注

16 pages, 9 figures