基于GPU加速的通用ASR上下文偏置框架:TurboBias
音频与语音处理
2025-08-13 v2 人工智能
计算与语言
声音
摘要
识别特定关键短语是上下文感知自动语音识别 (ASR)中的重要任务。然而,大多数现有上下文偏置方法都存在需要额外模型训练、显著延缓解码进程或限制ASR系统类型的局限性。本文提出了一个支持CTC、Transducer和Attention Encoder-Decoder等所有主要类型的通用ASR上下文偏置框架。该框架基于GPU加速的词汇提升树构建,能够以浅层融合模式集成到贪心和beam search解码中,即使在包含高达2万个关键短语的规模下,也几乎没有速度降低。实验结果表明,所提方法在准确率和解码速度方面均优于所考虑的开源上下文偏置方法。我们的上下文偏置框架已作为NeMo工具包的一部分开源。
引用
@article{arxiv.2508.07014,
title = {TurboBias: Universal ASR Context-Biasing powered by GPU-accelerated Phrase-Boosting Tree},
author = {Andrei Andrusenko and Vladimir Bataev and Lilit Grigoryan and Vitaly Lavrukhin and Boris Ginsburg},
journal= {arXiv preprint arXiv:2508.07014},
year = {2025}
}
备注
Accepted to ASRU 2025