透视未来:用于上下文偏置的注意力编码解码模型
计算与语言
2025-12-22 v1
摘要
虽然端到端(E2E)自动语音识别(ASR)模型在通用转录方面表现出色,但在识别稀有或未出现的专有名词(例如联系人姓名、地点)时仍感到困难,这些专有名词对于虚拟助手等下游应用至关重要。本文提出了一种针对基于注意力的编码解码(AED)模型的上下文偏置方法,利用候选专有名词列表。我们不仅预测下一个标记,还同时预测多个未来标记,使模型能够“透视未来”,对实体列表中的潜在候选实体进行评分。此外,我们的方法直接利用多标记预测逻辑概率,而无需额外的实体编码器或跨注意力层,显著降低了模型的架构复杂度。在 Librispeech 数据集上实验表明,与基线 AED 模型相比,我们的方法在专有名词词错误率上实现了最高可达 50.34% 的相对改进。
引用
@article{arxiv.2512.17657,
title = {Peeking Into The Future For Contextual Biasing},
author = {Ramaneswaran Selvakumar and Cindy Tseng and Eesung Kim and Vijendra Raj Apsingekar and Yun Tang},
journal= {arXiv preprint arXiv:2512.17657},
year = {2025}
}