中文

通过LLM集成理解零样本稀有词识别改进

计算与语言 2025-02-25 v1 音频与语音处理

摘要

本研究探讨了将大型语言模型(LLM)集成到自动语音识别(ASR)系统中的作用,具体关注增强稀有词识别性能。我们使用190,000小时主要来自YouTube的数据集,采用Whisper V3伪标签预处理,证明在大数据集上训练后,LLM-ASR架构在零样本稀有词识别任务中优于传统的Zipformer-Transducer模型。我们的分析表明,LLM对稀有词错误率(R-WER)的改进贡献显著,而语音编码器主要决定整体转录性能(正字词错误率O-WER和归一化词错误率N-WER)。通过大量消融研究,我们强调了适配器集成在对齐语音编码器输出与LLM语言能力方面的重要性。此外,我们强调了获得最佳性能需要高质量的标注数据。这些发现为LLM-based ASR架构之间的协同作用提供了有价值的见解,为未来在大规模LLM语音识别系统方面的发展指明了方向。

关键词

引用

@article{arxiv.2502.16142,
  title  = {Understanding Zero-shot Rare Word Recognition Improvements Through LLM Integration},
  author = {Haoxuan Wang},
  journal= {arXiv preprint arXiv:2502.16142},
  year   = {2025}
}