通过大型语言模型多粒度融合提高情境语音识别
计算与语言
2025-07-17 v1 人工智能
摘要
虽然端到端语音识别 (ASR) 模型在转录通用语音方面显示出惊人的性能,但它们往往难以准确识别与上下文相关的关键词,例如专有名词或用户特定实体。以前的做法探索了利用关键词字典在文本模态中提高关键词识别,方法是通过引导逐字生成的 token 级别融合,或通过实现关键词短语直接复制的 phrase 级别融合。然而,这些方法在不同的粒度上 operate,并存在各自的局限性。本文提出了一种新颖的多粒度融合方法,联合利用大型语言模型 (LLM) 的 token 级别和 phrase 级别融合的优势。我们的做法采用一种晚期融合策略,优雅地将 ASR 的声学信息与 LLM 的丰富上下文知识相结合,平衡细粒度 token 精度与整体 phrase 级别理解。在中文和英文数据集上的实验表明,我们的方法在与关键词相关的指标上实现了最先进的性能,同时保持了非关键词文本的高准确性。消融研究进一步表明,token 级别和 phrase 级别组件在我们的联合多粒度框架中都对性能提升贡献显著,相互补充。代码和模型将在 https://github.com/ 上公开。
引用
@article{arxiv.2507.12252,
title = {Improving Contextual ASR via Multi-grained Fusion with Large Language Models},
author = {Shilin Zhou and Zhenghua Li},
journal= {arXiv preprint arXiv:2507.12252},
year = {2025}
}