中文

SALSA:高效 ASR-LLM 同步聚合

计算与语言 2024-08-30 v1 机器学习 声音 音频与语音处理

摘要

利用预训练大语言模型(LLM)来改进语音识别(ASR)系统,尤其是针对低资源语言,已成为一个新兴的研究领域。现有方法要么用于 ASR 错误更正,要么是紧密耦合的系统,用 LLM 替代 ASR 解码器。这些方法要么增加解码时间,要么需要对交叉注意力层进行昂贵的训练。我们提出了 SALSA 方法,通过同步推进 ASR 和 LLM 解码器来实现耦合。这种耦合通过对最后一个解码状态进行简单投影实现,因此比早期方法在训练效率上显著更高。我们提出的耦合方法的一个挑战是处理 LLM 和 ASR 系统分词器之间的不匹配。我们采用相对于 LLM 和 ASR 词汇表的级联分词来处理这种不匹配。在 FLEURS 数据集上的 8 种低资源语言测试中,SALSA 实验结果显示,其显著降低了错误率(WER),降幅最高可达 38%。

关键词

引用

@article{arxiv.2408.16542,
  title  = {SALSA: Speedy ASR-LLM Synchronous Aggregation},
  author = {Ashish Mittal and Darshan Prabhu and Sunita Sarawagi and Preethi Jyothi},
  journal= {arXiv preprint arXiv:2408.16542},
  year   = {2024}
}

备注

Accepted to INTERSPEECH 2024