中文

面向语音理解的语音到文本适配器与语音到实体检索器增强大语言模型

音频与语音处理 2023-06-14 v1 人工智能 计算与语言

摘要

大语言模型(LLMs)已被应用于语音领域,常因语音与语言表征之间的错位而导致性能下降。为弥补这一差距,我们提出了一种联合语音与语言模型(SLM),使用 Speech2Text 适配器将语音映射至文本词嵌入空间而不损失语音信息。此外,利用基于 CTC 的空白过滤,我们可将语音序列长度缩减至文本长度。在语音 MultiWoz 数据集(DSTC11 挑战赛)上,SLM 大幅提升了对话状态跟踪(DST)性能(准确率从 24.7% 提升至 28.4%)。为进一步解决稀有实体上的错误,我们用 Speech2Entity 检索器增强 SLM,该检索器利用语音检索相关实体,并将其作为前缀添加至原始 SLM 输入。借助这一检索增强的 SLM(ReSLM),DST 性能跃升至 34.6% 准确率。此外,用对话理解任务增强 ASR 任务使 ASR 性能从 9.4% 提升至 8.5% WER。

关键词

引用

@article{arxiv.2306.07944,
  title  = {Speech-to-Text Adapter and Speech-to-Entity Retriever Augmented LLMs for Speech Understanding},
  author = {Mingqiu Wang and Izhak Shafran and Hagen Soltau and Wei Han and Yuan Cao and Dian Yu and Laurent El Shafey},
  journal= {arXiv preprint arXiv:2306.07944},
  year   = {2023}
}