基于 LoRA 专家的多模态和多粒度 LLM 生成式误差纠正用于带口音语音识别
声音
2025-07-22 v3 音频与语音处理
摘要
尽管自动语音识别取得了显著进展,但在带口音语音方面性能仍下降。生成式误差纠正(GER)利用大语言模型(LLM)的语言知识,优于传统语言模型方法。然而,它在带口音语音场景中缺乏针对性。口音代表标准发音的偏差,使得多粒度发音和语义信息对带口音语音识别至关重要。此外,口音差异显著,每种口音都具有独特特征。本研究通过解决这两个主要特征来提高转录准确率。我们提出了多模态 GER 方法,集成语音模态中的发音信息;以及多粒度 GER 方法,融合细粒度音素级发音信息。这些方法使 LLM 能够利用带口音语音的发音信息和词级假设的语义信息,通过低秩适应(LoRA)微调进行准确的转录预测。我们采用三阶段策略为每种口音训练独立的多模态 GER 模型,以获得单口音 LoRA 专家。通过采用包含层次路由和动态阈值的 HDMoLE 方法,我们有效地将单口音 LoRA 专家整合到单个多模态 GER 中,以克服口音多样性挑战。此外,多粒度 GER 利用 HDMoLE 模型从 N-best 词级和音素级假设中预测最终转录。在多口音英语数据集上的实验表明,我们的方法相对于基线的 vanilla Whisper-large-v3 模型将词错误率降低 67.35%。
引用
@article{arxiv.2507.09116,
title = {Mixture of LoRA Experts with Multi-Modal and Multi-Granularity LLM Generative Error Correction for Accented Speech Recognition},
author = {Bingshen Mu and Kun Wei and Pengcheng Guo and Lei Xie},
journal= {arXiv preprint arXiv:2507.09116},
year = {2025}
}
备注
IEEE Transactions on Audio, Speech and Language Processing