中文

Whisper in Medusa's Ear: 基于Transformer的ASR多头高效解码

音频与语音处理 2024-09-25 v1 人工智能 机器学习 声音

摘要

大型基于Transformer的模型在语音转录和翻译方面具有巨大潜力。其自注意力机制和并行处理能力使其能够捕捉音频序列中的复杂模式和依赖关系。然而,这种潜力也伴随着挑战,因为这些大型且计算密集型的模型会导致推理速度缓慢。为了提升性能,研究者提出了多种优化策略,包括高效的硬件利用和算法增强。在本文中,我们介绍了Whisper-Medusa,一种旨在以最小化对词错误率(WER)影响的前提下提升处理速度的新方法。所提出的模型扩展了OpenAI的Whisper架构,通过每次迭代预测多个token,从而将延迟降低了50%。我们展示了Whisper-Medusa在不同学习设置和数据集上的有效性。

关键词

引用

@article{arxiv.2409.15869,
  title  = {Whisper in Medusa's Ear: Multi-head Efficient Decoding for Transformer-based ASR},
  author = {Yael Segal-Feldman and Aviv Shamsian and Aviv Navon and Gill Hetz and Joseph Keshet},
  journal= {arXiv preprint arXiv:2409.15869},
  year   = {2024}
}

备注

Under Review