中文

ProGRes:基于 ASR n-best 的提示驱动生成式重排序

计算与语言 2024-09-10 v2 声音 音频与语音处理

摘要

大型语言模型(LLM)展示了通过有效地对在束搜索过程中生成的 n-best 假设进行重排序来提高语音识别器性能的能力。然而,如何充分利用最近的生成式指令调优 LLM 进行假设重排序仍不明确。本文提出了一种新方法,即使用经过指令调优的 LLM,通过合适的提示动态扩展语音识别 n-best 假设,并生成新的假设。具体而言,我们引入了一种新的零样本 ASR n-best 重排序方法,将置信度得分、LLM序列评分和提示基假设生成相结合。我们将 Llama-3-Instruct、GPT-3.5 Turbo 和 GPT-4 Turbo 作为提示生成器,与 Llama-3 作为序列评分 LLM 进行比较。我们使用不同的语音识别器评估了该方法,观察到词错误率(WER)显著改善,改善幅度在 5% 到 25% 之间。

关键词

引用

@article{arxiv.2409.00217,
  title  = {ProGRes: Prompted Generative Rescoring on ASR n-Best},
  author = {Ada Defne Tur and Adel Moumen and Mirco Ravanelli},
  journal= {arXiv preprint arXiv:2409.00217},
  year   = {2024}
}

备注

IEEE Spoken Language Technology Workshop