单 Trie 路径中全局与近似上下文双向偏置的统一
计算与语言
2025-09-05 v2 声音
音频与语音处理
摘要
尽管端到端自动语音识别(ASR)模型取得了显著成功,但在识别稀有、词汇表外词——包括专有名词(NE)——以及仅使用文本数据适应新领域方面仍存在挑战。本 work 提出了一种实用方法,通过结合 NE 偏置列表和单词级 n gram 语言模型(LM)来解决这些挑战。该解决方案在简单性和有效性之间取得了平衡,显著提升专有名词的识别率,同时保持甚至提升整体 ASR 性能。我们高效地将这种丰富的偏置方法集成到基于 transducer 的 ASR 系统中,几乎没有计算开销即可实现上下文适应。我们在覆盖四种语言的三个数据集上展示了结果,并与最先进的偏置策略进行了比较。我们证明,关键词偏置和 n-gram LM 的组合可提高实体识别率最高可达 32%,并将整体 WER 降低最高可达 12%。
引用
@article{arxiv.2409.13514,
title = {Unifying Global and Near-Context Biasing in a Single Trie Pass},
author = {Iuliia Thorbecke and Esaú Villatoro-Tello and Juan Zuluaga-Gomez and Shashi Kumar and Sergio Burdisso and Pradeep Rangappa and Andrés Carofilis and Srikanth Madikeri and Petr Motlicek and Karthik Pandia and Kadri Hacioğlu and Andreas Stolcke},
journal= {arXiv preprint arXiv:2409.13514},
year = {2025}
}
备注
Accepted to TSD2025