WCTC-Biasing:基于通配符 CTC 关键词 spotting 与层间偏置的免重训上下文偏置 ASR
计算与语言
2025-06-03 v1 声音
音频与语音处理
摘要
尽管端到端语音识别方法近期取得了进展,但其输出往往偏向于训练数据的词汇,导致对专有名词和其他未知术语的识别不准确。为了解决这个问题,我们提出了一种在基于 CTC 的模型中无需额外训练或文本转语音系统即可提高此类罕见词识别准确率的方法。具体而言,在推理过程中利用中间层的声学特征进行关键词 spotting,并对声学模型中检测到关键词的后续层施加偏置。对于关键词检测,我们采用了通配符 CTC,它既快速又能容忍模糊匹配,从而能够灵活处理那些难以严格匹配的单词。由于该方法不需要对现有模型进行重训,因此甚至可以轻松应用于大规模模型。在日语语音识别实验中,所提出的方法在未知词的 F1 分数上实现了 29% 的提升。
引用
@article{arxiv.2506.01263,
title = {WCTC-Biasing: Retraining-free Contextual Biasing ASR with Wildcard CTC-based Keyword Spotting and Inter-layer Biasing},
author = {Yu Nakagome and Michael Hentschel},
journal= {arXiv preprint arXiv:2506.01263},
year = {2025}
}
备注
Accepted to Interspeech 2025