中文

Wav2Prompt: 面向大语言模型零样本和少样本学习的端到端语音提示生成与调优

音频与语音处理 2024-06-05 v1 声音

摘要

提出了Wav2Prompt,它允许语音输入与基于文本的大语言模型(LLM)之间进行直接集成。Wav2Prompt使用一个简单的训练过程,仅使用与训练自动语音识别(ASR)模型相同的数据。训练后,Wav2Prompt从语音中学习连续表示,并将其用作LLM提示。为了避免先前工作中发现的任务过拟合问题并保留LLM的新兴能力,Wav2Prompt将LLM词元嵌入作为训练目标,并利用连续积分-触发机制进行显式的语音-文本对齐。因此,Wav2Prompt-LLM组合可以应用于零样本口语语言任务,例如语音翻译(ST)、口语理解(SLU)、语音问答(SQA)和基于口语查询的问答(SQQA)。结果表明,对于这些零样本任务,Wav2Prompt的表现与ASR-LLM级联系统相似,且优于最近的先前工作。如果在少样本场景中有相对少量的任务特定配对数据可用,则Wav2Prompt-LLM组合可以进行端到端(E2E)微调。此时,对于上述任务,Wav2Prompt-LLM组合相对于ASR-LLM级联系统产生了显著改善的结果。例如,对于使用BLOOMZ-7B1 LLM的英法ST任务,Wav2Prompt-LLM组合比ASR-LLM级联系统提高了8.5个BLEU点。

关键词

引用

@article{arxiv.2406.00522,
  title  = {Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning},
  author = {Keqi Deng and Guangzhi Sun and Philip C. Woodland},
  journal= {arXiv preprint arXiv:2406.00522},
  year   = {2024}
}