中文

激发 Web 规模语音模型的隐藏能力以实现零样本任务泛化

音频与语音处理 2023-08-17 v3 人工智能 计算与语言 机器学习 声音

摘要

我们通过提示工程将近期提出的 web 规模语音模型 Whisper 适配至未知任务,以探究其涌现能力。我们选取了三项任务:音视觉语音识别(AVSR)、语码转换语音识别(CS-ASR)以及未见语言对的语音翻译(ST)。我们设计任务特定提示,或借助另一大规模模型,或仅操控默认提示中的特殊词元。实验表明,相较于默认提示,我们所提提示在三项零样本任务上带来 10% 至 45% 的性能提升,甚至在某些数据集上超越 SOTA 监督模型。此外,我们的实验揭示了 Whisper 的诸多有趣特性,包括其对提示的鲁棒性、对口音的偏置,以及其潜空间中的多语言理解能力。代码见 https://github.com/jasonppy/PromptingWhisper。

关键词

引用

@article{arxiv.2305.11095,
  title  = {Prompting the Hidden Talent of Web-Scale Speech Models for Zero-Shot Task Generalization},
  author = {Puyuan Peng and Brian Yan and Shinji Watanabe and David Harwath},
  journal= {arXiv preprint arXiv:2305.11095},
  year   = {2023}
}

备注

Interspeech 2023