使用大语言模型进行端到端中文语音识别和命名实体识别
计算与语言
2024-06-07 v2 人工智能
摘要
将语音标记映射到与文本标记相同的特征空间已成为将语音模态集成到仅解码器大语言模型(LLM)中的范式。另一种方法是使用编码器-解码器架构,通过交叉注意力融入语音特征。然而,这种方法在文献中受到的关注较少。在这项工作中,我们将Whisper编码器与ChatGLM3连接起来,并使用中文自动语音识别(ASR)和命名实体识别(NER)任务对这两种方法进行了深入比较。我们不仅使用传统的指标(如F1分数)进行评估,还使用一种新颖的细粒度ASR-NER错误分类法进行评估。我们的实验表明,在短上下文下,编码器-解码器架构优于仅解码器架构,而仅解码器架构在长上下文下受益,因为它充分利用了LLM的所有层。通过使用LLM,与Conformer基线相比,我们显著减少了实体遗漏错误,并提高了实体ASR准确率。此外,通过使用思维链(CoT)NER(首先推断长格式ASR转录,然后预测NER标签),我们在AISHELL-NER测试集上获得了0.805的最先进(SOTA)F1分数。
引用
@article{arxiv.2401.11382,
title = {Using Large Language Model for End-to-End Chinese ASR and NER},
author = {Yuang Li and Jiawei Yu and Min Zhang and Mengxin Ren and Yanqing Zhao and Xiaofeng Zhao and Shimin Tao and Jinsong Su and Hao Yang},
journal= {arXiv preprint arXiv:2401.11382},
year = {2024}
}
备注
5 pages, 2 figures, Accepted to InterSpeech 2024