MMGER:结合大语言模型的多模态多粒度生成式纠错用于联合口音与语音识别
音频与语音处理
2024-05-08 v1 声音
摘要
尽管自动语音识别(ASR)取得了显著进展,但在面对不利条件时性能往往会下降。生成式纠错(GER)利用大语言模型(LLM)卓越的文本理解能力,在ASR纠错中取得了令人印象深刻的性能,其中N-best假设为转录预测提供了有价值的信息。然而,GER面临着固定N-best假设、声学信息利用不足以及多口音场景特异性有限等挑战。本文探讨了GER在多口音场景中的应用。口音代表对标准发音规范的偏离,同时进行ASR和口音识别(AR)的多任务学习框架已有效解决了多口音场景,使其成为一种突出的解决方案。本文提出了一种统一的ASR-AR GER模型,命名为MMGER,利用多模态纠错和多粒度纠错。采用多任务ASR-AR学习来提供动态的1-best假设和口音嵌入。多模态纠错通过将语音的声学特征与相应的字符级1-best假设序列进行强制对齐,实现细粒度的帧级纠错。多粒度纠错通过在细粒度多模态纠错之上结合常规的1-best假设来补充全局语言信息,从而实现粗粒度的语句级纠错。MMGER有效缓解了GER的局限性,并为多口音场景定制了基于LLM的ASR纠错。在多口音普通话KeSpeech数据集上进行的实验证明了MMGER的有效性,与建立的标准基线相比,AR准确率相对提高了26.72%,ASR字符错误率相对降低了27.55%。
引用
@article{arxiv.2405.03152,
title = {MMGER: Multi-modal and Multi-granularity Generative Error Correction with LLM for Joint Accent and Speech Recognition},
author = {Bingshen Mu and Yangze Li and Qijie Shao and Kun Wei and Xucheng Wan and Naijun Zheng and Huan Zhou and Lei Xie},
journal= {arXiv preprint arXiv:2405.03152},
year = {2024}
}