PMF-CEC:基于音素增强的多模态融合用于上下文感知 ASR 错误纠正
音频与语音处理
2025-06-16 v1 人工智能
计算与语言
声音
摘要
端到端自动语音识别(ASR)模型常常难以准确识别罕见词汇。此前我们引入了一种称为错误检测和上下文感知错误纠正(ED-CEC)的 ASR 后处理方法,利用命名实体和技术术语等上下文信息来提高 ASR 转录的准确性。尽管 ED-CEC 在纠正罕见词汇方面取得了显著成果,但在处理发音相似但拼写不同的罕见词时,其准确率仍较低。为此,我们在 ED-CEC 基础上提出了一种基于音素增强的多模态融合方法,用于上下文感知错误纠正(PMF-CEC),以实现对目标罕见词与同音词的更好区分。此外,我们注意到以前的 ASR 错误检测模块存在过检测问题。为缓解此问题,我们引入了保留概率机制,以过滤置信度得分低于设定阈值的编辑操作,保留原始操作,以提高错误检测的准确性。在五个数据集上的实验表明,我们提出的 PMF-CEC 在保持合理推理速度的同时,进一步降低了偏向性词错误率,在纠正同音词方面显示出更大的优势。此外,我们的方法在其他上下文偏置方法之上表现更佳,在大型偏置列表下仍具快速推理和更好鲁棒性优势。
引用
@article{arxiv.2506.11064,
title = {PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding},
author = {Jiajun He and Tomoki Toda},
journal= {arXiv preprint arXiv:2506.11064},
year = {2025}
}
备注
Accepted by IEEE TASLP 2025