面向长尾语音识别的有效上下文平衡适应方法
计算与语言
2024-09-11 v1 人工智能
声音
音频与语音处理
摘要
端到端(E2E)自动语音识别(ASR)模型已成为 various commercial applications 中标准做法。然而在实际场景中,词汇分布的长尾特性常导致 E2E ASR 模型在常见词上表现良好,但在识别不常见词时表现不足。最近,一种上下文适配器(Contextual Adapter, CA)被提出,用于将由上下文词表表示的外部知识注入 E2E ASR 模型。虽然 CA 能提升对罕见词的识别性能,但仍存在两个关键数据不平衡问题。首先,当使用低频词作为训练中的上下文词时,由于这些词在 utterance 中极少出现,而高频词未被包含在上下文表中,导致 CA 容易过拟合到关注 <no-context> token。其次,上下文表本身的长尾分布仍导致模型在低频上下文词上表现不佳。基于此,我们深入探讨了改变上下文表以获得不同频率分布的词语对模型性能的影响,并扩展了简单而有效的上下文平衡学习目标。一系列在 AISHELL-1 数据集上的实验表明,使用来自训练语料库中所有词汇作为上下文表,并搭配我们的平衡目标可获得最佳性能,显著将字符错误率(CER)降低最高可达 1.21%,对零样本词的错误率降低幅度更为显著,达 9.44%。
引用
@article{arxiv.2409.06468,
title = {An Effective Context-Balanced Adaptation Approach for Long-Tailed Speech Recognition},
author = {Yi-Cheng Wang and Li-Ting Pai and Bi-Cheng Yan and Hsin-Wei Wang and Chi-Han Lin and Berlin Chen},
journal= {arXiv preprint arXiv:2409.06468},
year = {2024}
}
备注
Accepted by SLT 2024