基于问答驱动的零样本端到端口语理解中的 Whisper 提示策略
音频与语音处理
2024-06-24 v1
摘要
零样本口语语言理解(SLU)使系统能够在无训练数据曝露的情况下理解用户新领域的语音指令。近期研究常依赖大型语言模型(LLM),导致资源占用和复杂度过高。本文提出使用 Whisper 这一独立的语音处理模型实现零样本端到端(E2E)SLU。为处理未见的语义标签,将 SLU 任务集成到问答(QA)框架中,对话 Whisper 解码器进行提示以实现语义推断。该系统通过前缀调优进行高效训练,优化的是 Whisper 模型的最小参数集合,而非整个模型。我们表明,所提出的系统在 SLURP 数据集上实现了槽填充(SLU-F1)提升了 40.7 个百分点。此外,在语料内和跨语料的评估设置下,其性能与 Whisper-GPT-2 模块化系统相当,但模型参数减少了 34.8%。
引用
@article{arxiv.2406.15209,
title = {Prompting Whisper for QA-driven Zero-shot End-to-end Spoken Language Understanding},
author = {Mohan Li and Simon Keizer and Rama Doddipatla},
journal= {arXiv preprint arXiv:2406.15209},
year = {2024}
}
备注
Accepted to Interspeech 2024