中文

基于热词检索与强化学习的大语言模型语音识别上下文偏置

音频与语音处理 2025-12-29 v1

摘要

基于大语言模型 (LLM) 的自动语音识别 (ASR) 近期在多种任务中取得了优异的性能,然而在大词表下针对命名实体和热词的上下文偏置仍然具有挑战性。在本工作中,我们提出了一种可扩展的两阶段框架,将热词检索与 LLM-ASR 适配相结合。首先,我们扩展了全局-局部对比语言-音频预训练模型 (GLCLAP),通过鲁棒性感知的数据增强和模糊匹配,从大词表中检索一个紧凑的 top-k 热词候选集。其次,我们将检索到的候选集作为文本提示注入 LLM-ASR 模型,并使用生成式基于拒绝的策略优化 (GRPO) 对其进行微调,采用一种任务驱动的奖励来联合优化热词识别和整体转录准确率。在以热词为中心的测试集上的实验表明,关键词错误率 (KER) 显著降低,同时在通用 ASR 基准上保持了句子准确率,证明了所提出的框架对于大词表上下文偏置的有效性。

关键词

引用

@article{arxiv.2512.21828,
  title  = {Contextual Biasing for LLM-Based ASR with Hotword Retrieval and Reinforcement Learning},
  author = {YuXiang Kong and JunFeng Hou and Jian Tang and Bingqing Zhu and Jicheng Zhang and Shaofei Xue},
  journal= {arXiv preprint arXiv:2512.21828},
  year   = {2025}
}