在端到端语音识别中利用指令微调大语言模型的零样本能力
音频与语音处理
2025-01-08 v3 计算与语言
声音
摘要
我们提出利用指令微调大语言模型(LLM)来引导自动语音识别(ASR)中的文本生成过程。现代大语言模型(LLM)擅长通过零样本学习,借助针对特定目标设计的指令来执行各种文本生成任务。本文探讨了LLM在端到端ASR模型中推导可促进文本生成的语言学信息的潜力。具体而言,我们指示LLM纠正ASR假设中的语法错误,并利用LLM推导的表示进一步精炼输出。所提模型构建于联合CTC与注意力架构之上,以LLM作为解码器的前端特征提取器。待纠正的ASR假设由编码器经CTC解码获得,并与特定指令一同输入LLM。解码器随后以LLM输出作为输入进行词元预测,结合来自编码器的声学信息与LLM提供的强大语言学信息。实验结果表明,所提LLM引导模型在主要基准上取得了约13%的词错误率相对提升。
引用
@article{arxiv.2309.10524,
title = {Harnessing the Zero-Shot Power of Instruction-Tuned Large Language Model in End-to-End Speech Recognition},
author = {Yosuke Higuchi and Tetsuji Ogawa and Tetsunori Kobayashi},
journal= {arXiv preprint arXiv:2309.10524},
year = {2025}
}
备注
Accepted to ICASSP2025