PARCO:基于对比实体消歧的音素增强鲁棒上下文 ASR
计算与语言
2025-09-05 v1 人工智能
机器学习
声音
摘要
自动语音识别(ASR)系统在处理特定领域的命名实体时存在困难,尤其是同音词。上下文 ASR 改善了识别效果,但由于实体多样性有限,通常无法捕捉细粒度的音素变化。此外,先前的方法将实体视为独立的标记,导致多标记偏置不完整。为了解决这些问题,我们提出了基于对比实体消歧的音素增强鲁棒上下文 ASR(PARCO),它集成了音素感知编码、对比实体消歧、实体级监督和分层实体过滤。这些组件增强了语音区分能力,确保了完整的实体检索,并减少了不确定性下的假阳性。实验表明,PARCO 在中文 AISHELL-1 上实现了 4.22% 的 CER,在 1,000 个干扰项下的英文 DATA2 上实现了 11.14% 的 WER,显著优于基线。PARCO 在 THCHS-30 和 LibriSpeech 等域外数据集上也表现出稳健的提升。
引用
@article{arxiv.2509.04357,
title = {PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation},
author = {Jiajun He and Naoki Sawada and Koichi Miyazaki and Tomoki Toda},
journal= {arXiv preprint arXiv:2509.04357},
year = {2025}
}
备注
Accepted by ASRU 2025