中文

基于常见单词提示和偏词位置预测的ASR语境偏置

计算与语言 2026-04-15 v1

摘要

语音感知LLM(SLLM)最近取得了ASR的最佳性能;然而,它们仍然难以准确转录训练数据中罕见或从未出现的偏词。语境偏置机制通常通过引入文本提示或额外模块来实现预定义的偏词列表。为了进一步提高效果,可以将预定义的偏词与其音素表示配对作为发音提示。通常情况下,音素序列通过G2P系统生成,该系统覆盖偏词的目标语言和领域。因此,在G2P系统不可用时,音素辅助语境偏置就难以实现。此外,手动添加准确的音素序列需要专业的语音学知识。本文我们探索了基于一组常见单词的声学提示实现的SLLM语境偏置,这些单词的发音部分类似于目标偏词的发音。我们假设ASR应用中,最终用户不需要特殊的语音学知识或使用G2P工具进行推理。在可靠性方面,我们还引入了在多输出学习方式中实现的偏词位置预测。我们的方法将偏词识别错误降低了16.3%,包括在外域数据上。

关键词

引用

@article{arxiv.2604.12397,
  title  = {KoCo: Conditioning Language Model Pre-training on Knowledge Coordinates},
  author = {Yudong Li and Jiawei Cai and Linlin Shen},
  journal= {arXiv preprint arXiv:2604.12397},
  year   = {2026}
}

备注

Accepted by ACL 2026 Main Conference