中文

PAC:发音感知的上下文化大型语言模型自动语音识别

计算与语言 2025-09-17 v1 音频与语音处理

摘要

本文提出了一种发音感知的上下文化(PAC)框架,以解决基于大型语言模型(LLM)的自动语音识别(ASR)系统中的两个关键挑战:有效的发音建模与鲁棒的同音词辨别。两者对于原始词或长尾词的识别均至关重要。所提出的方法采用两阶段学习范式。首先,我们引入了一种发音引导的上下文学习方法。该方法采用字素-音素交织的上下文建模策略,并引入纯字素干扰项,鼓励模型利用音素线索进行准确识别。随后,我们提出了一种带有扰动标签采样的发音判别强化学习方法,以进一步增强模型区分上下文化同音词的能力。在公开的英语 Librispeech 与中文 AISHELL-1 数据集上的实验结果表明,PAC:(1)与预训练的基于 LLM 的 ASR 模型相比,将相对词错误率(WER)降低了 30.2% 和 53.8%;(2)与强基线相比,长尾词的偏置 WER 分别实现了 31.8% 和 60.5% 的相对降低。

关键词

引用

@article{arxiv.2509.12647,
  title  = {PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition},
  author = {Li Fu and Yu Xin and Sunlu Zeng and Lu Fan and Youzheng Wu and Xiaodong He},
  journal= {arXiv preprint arXiv:2509.12647},
  year   = {2025}
}

备注

Submitted to ICASSP 2026