中文

Whisper:Courtside 版通过基于大语言模型的上下文生成提升语音识别性能

计算与语言 2026-02-24 v1

摘要

领域特定的语音识别仍然是自动语音识别(ASR)的一个持续性挑战,即便是像 OpenAI 的 Whisper 这样的领先系统。我们介绍 Whisper:Courtside 版,这是一个新型的多智能体大语言模型(LLM)管道,通过无需重新训练的方式提升 Whisper 转录结果。该管道拦截 Whisper 的初始转录,应用专门的 LLM 智能体进行领域上下文识别、命名实体识别和术语检测,并生成紧凑的提示词来指导 Whisper 的解码器。我们在 421 段 NBA 篮球解说(该领域以大量专有名词和技术术语为特征)上进行评估,我们最佳管道实现了 17.0% 的相对词错误率(WER;从 0.217 降至 0.180,p<0.001)的统计显著性降低。在 40.1% 的段落中均有改进,仅有 7.1% 的段落出现退化,显著优于直接的转录后编辑。这些结果表明,基于提示的增强可以为语音识别提供可扩展的领域适应方案,为昂贵的模型微调提供了实用的替代方案。

关键词

引用

@article{arxiv.2602.18966,
  title  = {Whisper: Courtside Edition Enhancing ASR Performance Through LLM-Driven Context Generation},
  author = {Yonathan Ron and Shiri Gilboa and Tammuz Dubnov},
  journal= {arXiv preprint arXiv:2602.18966},
  year   = {2026}
}