中文

WHISMA:用于零样本口语语言理解的语音-LLM

音频与语音处理 2024-08-30 v1 声音

摘要

语音大语言模型(speech-LLMs)将语音和文本基础模型集成,提供处理各种下游任务的统一框架。本文介绍 WHISMA,一种为口语语言理解(SLU)量身定制的语音-LLM,在各种零样本设置下表现出稳健的性能。WHISMA 将 Whisper 的语音编码器与 Llama-3 LLM 结合,并在全面收录的 SLU 相关数据集上进行参数高效微调。我们的实验表明,WHISMA 在 SLURP 基准测试上的零样本槽位填充性能显著提升,相对于当前最先进模型实现 26.6% 的相对提升。此外,为评估 WHISMA 对未知领域的泛化能力,我们开发了一个新的任务无关基准SLU-GLUE。评估结果表明,WHISMA 在现有语音-LLM(Qwen-Audio)方面实现 33.0% 的相对提升。

关键词

引用

@article{arxiv.2408.16423,
  title  = {WHISMA: A Speech-LLM to Perform Zero-shot Spoken Language Understanding},
  author = {Mohan Li and Cong-Thanh Do and Simon Keizer and Youmna Farag and Svetlana Stoyanchev and Rama Doddipatla},
  journal= {arXiv preprint arXiv:2408.16423},
  year   = {2024}
}

备注

accepted to SLT 2024