中文

基于大语言模型的超大规模多语言浅融合

计算与语言 2023-02-20 v1 机器学习

摘要

尽管大语言模型(LLM)在自然语言处理方面取得了令人瞩目的进展,但如何利用它们来改进自动语音识别(ASR)仍不清楚。在这项工作中,我们提出训练一个单一的多语言语言模型(LM)用于多种语言中的浅融合。我们通过使用专家混合 LLM(即通用语言模型(GLaM))进行扩展,将多语言 LM 的极限推至覆盖多达 84 种语言。当专家数量增加时,GLaM 在每一步解码时动态选择仅两个专家,以使推理计算量大致恒定。然后我们将 GLaM 应用于基于最先进端到端模型的多语言浅融合任务。与推理期间计算量相近的稠密 LM 相比,GLaM 将英语长尾测试集的词错率(WER)相对降低了 4.4%。在多语言浅融合任务中,GLaM 在 50 种语言中的 41 种上取得改进,平均相对 WER 降低 3.85%,最大降低 10%。与基线模型相比,GLaM 在 43 种语言上平均 WER 降低 5.53%。

关键词

引用

@article{arxiv.2302.08917,
  title  = {Massively Multilingual Shallow Fusion with Large Language Models},
  author = {Ke Hu and Tara N. Sainath and Bo Li and Nan Du and Yanping Huang and Andrew M. Dai and Yu Zhang and Rodrigo Cabrera and Zhifeng Chen and Trevor Strohman},
  journal= {arXiv preprint arXiv:2302.08917},
  year   = {2023}
}

备注

Accepted to IEEE ICASSP 2023