SALSA:高效 ASR-LLM 同步聚合
计算与语言
2024-08-30 v1 机器学习
声音
音频与语音处理
摘要
利用预训练大语言模型(LLM)来改进语音识别(ASR)系统,尤其是针对低资源语言,已成为一个新兴的研究领域。现有方法要么用于 ASR 错误更正,要么是紧密耦合的系统,用 LLM 替代 ASR 解码器。这些方法要么增加解码时间,要么需要对交叉注意力层进行昂贵的训练。我们提出了 SALSA 方法,通过同步推进 ASR 和 LLM 解码器来实现耦合。这种耦合通过对最后一个解码状态进行简单投影实现,因此比早期方法在训练效率上显著更高。我们提出的耦合方法的一个挑战是处理 LLM 和 ASR 系统分词器之间的不匹配。我们采用相对于 LLM 和 ASR 词汇表的级联分词来处理这种不匹配。在 FLEURS 数据集上的 8 种低资源语言测试中,SALSA 实验结果显示,其显著降低了错误率(WER),降幅最高可达 38%。
引用
@article{arxiv.2408.16542,
title = {SALSA: Speedy ASR-LLM Synchronous Aggregation},
author = {Ashish Mittal and Darshan Prabhu and Sunita Sarawagi and Preethi Jyothi},
journal= {arXiv preprint arXiv:2408.16542},
year = {2024}
}
备注
Accepted to INTERSPEECH 2024