中文

基于CTC单词探测器的CTC与Transducer ASR模型快速上下文偏置

音频与语音处理 2024-06-12 v1 人工智能 计算与语言 机器学习 声音

摘要

准确识别稀有和新词在上下文化自动语音识别(ASR)系统中仍是一个迫在眼睫的问题。大多数上下文偏置方法涉及修改ASR模型或束搜索解码算法,这会使模型复用复杂化并减慢推理速度。本工作提出了一种基于CTC单词探测器(CTC-WS)的快速上下文偏置方法,适用于CTC和Transducer(RNN-T)ASR模型。该方法通过将CTC对数概率与紧凑的上下文图进行匹配,以检测潜在的上下文偏置候选对象。有效的候选对象随后在相应帧区间中替换其贪心识别对应物。混合Transducer-CTC模型使CTC-WS能够应用于Transducer模型。结果表明,与基线方法相比,本方法显著加快了上下文偏置识别速度,同时在F-score和WER上实现同步提升。该方法已公开于NVIDIA NeMo工具包中。

关键词

引用

@article{arxiv.2406.07096,
  title  = {Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter},
  author = {Andrei Andrusenko and Aleksandr Laptev and Vladimir Bataev and Vitaly Lavrukhin and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2406.07096},
  year   = {2024}
}

备注

Accepted by Interspeech 2024