面向改进 LLM 预测的 RNNT 损失下语音前缀调优
人工智能
2024-06-24 v1 计算与语言
声音
音频与语音处理
摘要
本文聚焦于解决将 LLM 应用于语音识别 (ASR) 时面临的限制。近期研究利用前缀 LM 类型模型,直接将语音作为前缀输入 LLM 以实现 ASR。我们发现,优化语音前缀可获得更好的 ASR 性能,提出在语音前缀调优中应用 RNNT 损失。这是一种简单方法,既不增加模型复杂度,又不改变推理流程。我们还提出基于语言的软提示进一步通过冻结 LLM 来提高效果。在 10 种印度语言的实时测试集上进行经验分析,表明我们提出的语音前缀调优在冻结和微调 LLM 两种情况下均取得改进。我们的识别结果显示,在 10 种印度语言的平均性能上,采用 RNNT 损失的前缀调优相对于采用微调 LLM 的基线实现 12% 的相对 WER 改进。我们提出的方法在冻结 LLM 的情况下相对于基本软提示前缀 LM 实现 31% 的相对改进。
引用
@article{arxiv.2406.14701,
title = {Speech Prefix-Tuning with RNNT Loss for Improving LLM Predictions},
author = {Murali Karthick Baskar and Andrew Rosenberg and Bhuvana Ramabhadran and Neeraj Gaur and Zhong Meng},
journal= {arXiv preprint arXiv:2406.14701},
year = {2024}
}