中文

SpeechCLIP:将语音与预训练视觉及语言模型相集成

计算与语言 2022-10-26 v2 声音 音频与语音处理

摘要

数据驱动的语音处理模型通常在大量文本监督下表现良好,但收集转写语音数据成本高昂。因此,我们提出 SpeechCLIP,一种通过图像桥接语音与文本、无需转写即可增强语音模型的新框架。我们利用最先进的预训练 HuBERT 与 CLIP,通过配对图像与口语描述进行最小微调以实现对齐。SpeechCLIP 在图像-语音检索上优于先前最优方法,并在无转写直接监督的情况下实现零样本语音-文本检索。此外,SpeechCLIP 可直接从语音中检索语义相关关键词。

关键词

引用

@article{arxiv.2210.00705,
  title  = {SpeechCLIP: Integrating Speech with Pre-Trained Vision and Language Model},
  author = {Yi-Jen Shih and Hsuan-Fu Wang and Heng-Jui Chang and Layne Berry and Hung-yi Lee and David Harwath},
  journal= {arXiv preprint arXiv:2210.00705},
  year   = {2022}
}

备注

Accepted to IEEE SLT 2022