中文

基于 K 步预测的高效 Trie 存储偏置方法用于稀有词识别

计算与语言 2025-09-12 v1 人工智能

摘要

情境偏置通过在解码时优先考虑稀有词的输出来提高 ASR 模型的稀有词识别。常见方法是 Trie 存储偏置, 它为可能导致稀有词 (例如 ``Bonham'') 生成的部分假设 (例如 ``Bon'') 提供 ``bonus scores''。如果完整单词 (``Bonham'') 最终未被识别, 系统会撤销这些早期奖励。这一撤销 limited to beam search, 且 computation-expensive, particularly for models with large decoders。为克服这些限制, 我们提出了适应 ASR 模型以提前预测多个步骤的方法。这通过更准确地估计部分假设是否会导致生成完整稀有词来完全避免撤销步骤。通过仅使用 10 小时合成数据 fine-tuning Whisper, 我们的方法将 NSC Part 2 测试集上的词错误率从 30.86% 降低到 12.19%。

关键词

引用

@article{arxiv.2509.09196,
  title  = {Efficient Trie-based Biasing using K-step Prediction for Rare Word Recognition},
  author = {Chin Yuen Kwok and Jia Qi yip},
  journal= {arXiv preprint arXiv:2509.09196},
  year   = {2025}
}

备注

Published in Interspeech 2025