WAVPROMPT:基于冻结语言模型的少样本语音语言理解
音频与语音处理
2022-04-15 v2 人工智能
计算与语言
摘要
在大规模文本上预训练的大规模自回归语言模型已展现出仅凭少量文本样例即可执行新自然语言任务的能力,无需微调。近期研究进一步表明,通过训练编码器将图像编码为类似语言模型文本嵌入的嵌入,此类少样本学习能力可扩展至文本-图像场景。出于探索将少样本学习能力迁移至音频-文本场景的可能性的兴趣,我们提出一种新颖的语音理解框架 WavPrompt,其中我们微调 wav2vec 模型以生成语言模型可理解的音频嵌入序列。我们表明 WavPrompt 是一种少样本学习器,其在语音理解任务上的表现优于朴素文本基线。我们对不同组件与超参数进行了详细消融研究,以经验性地确定最佳模型配置。此外,我们进行了非语音理解实验,表明 WavPrompt 可提取超出转写文本之外的更多信息。代码见 https://github.com/Hertin/WavPrompt
引用
@article{arxiv.2203.15863,
title = {WAVPROMPT: Towards Few-Shot Spoken Language Understanding with Frozen Language Models},
author = {Heting Gao and Junrui Ni and Kaizhi Qian and Yang Zhang and Shiyu Chang and Mark Hasegawa-Johnson},
journal= {arXiv preprint arXiv:2203.15863},
year = {2022}
}
备注
submitted to INTERSPEECH 2022