ProGRes:基于 ASR n-best 的提示驱动生成式重排序
计算与语言
2024-09-10 v2 声音
音频与语音处理
摘要
大型语言模型(LLM)展示了通过有效地对在束搜索过程中生成的 n-best 假设进行重排序来提高语音识别器性能的能力。然而,如何充分利用最近的生成式指令调优 LLM 进行假设重排序仍不明确。本文提出了一种新方法,即使用经过指令调优的 LLM,通过合适的提示动态扩展语音识别 n-best 假设,并生成新的假设。具体而言,我们引入了一种新的零样本 ASR n-best 重排序方法,将置信度得分、LLM序列评分和提示基假设生成相结合。我们将 Llama-3-Instruct、GPT-3.5 Turbo 和 GPT-4 Turbo 作为提示生成器,与 Llama-3 作为序列评分 LLM 进行比较。我们使用不同的语音识别器评估了该方法,观察到词错误率(WER)显著改善,改善幅度在 5% 到 25% 之间。
引用
@article{arxiv.2409.00217,
title = {ProGRes: Prompted Generative Rescoring on ASR n-Best},
author = {Ada Defne Tur and Adel Moumen and Mirco Ravanelli},
journal= {arXiv preprint arXiv:2409.00217},
year = {2024}
}
备注
IEEE Spoken Language Technology Workshop