融合大语言模型的多语言全非自回归 ASR:一项全面研究
计算与语言
2024-01-24 v1 声音
音频与语音处理
摘要
在大模型时代,解码的自回归特性通常会导致延迟成为显著的瓶颈。我们提出了一种非自回归的 LM 融合 ASR 系统,该系统有效利用了加速器硬件的并行化能力。我们的方法将 Universal Speech Model (USM) 和 PaLM 2 语言模型结合在逐段评分模式下,在 FLEURS 上实现了所有语言平均相对 WER 提升 10.8%,在 YouTube 字幕生成上提升了 3.6%。此外,我们全面的消融研究分析了关键参数,如 LLM 大小、上下文长度、词表大小和融合方法。例如,我们探讨了参数量从 128M 到 340B 的 LLM 大小对 ASR 性能的影响。本研究为影响实用大规模 LM 融合语音识别系统有效性的因素提供了有价值的见解。
引用
@article{arxiv.2401.12789,
title = {Multilingual and Fully Non-Autoregressive ASR with Large Language Model Fusion: A Comprehensive Study},
author = {W. Ronny Huang and Cyril Allauzen and Tongzhou Chen and Kilol Gupta and Ke Hu and James Qin and Yu Zhang and Yongqiang Wang and Shuo-Yiin Chang and Tara N. Sainath},
journal= {arXiv preprint arXiv:2401.12789},
year = {2024}
}
备注
ICASSP 2024