SpeechCLIP:将语音与预训练视觉及语言模型相集成
计算与语言
2022-10-26 v2 声音
音频与语音处理
摘要
数据驱动的语音处理模型通常在大量文本监督下表现良好,但收集转写语音数据成本高昂。因此,我们提出 SpeechCLIP,一种通过图像桥接语音与文本、无需转写即可增强语音模型的新框架。我们利用最先进的预训练 HuBERT 与 CLIP,通过配对图像与口语描述进行最小微调以实现对齐。SpeechCLIP 在图像-语音检索上优于先前最优方法,并在无转写直接监督的情况下实现零样本语音-文本检索。此外,SpeechCLIP 可直接从语音中检索语义相关关键词。
引用
@article{arxiv.2210.00705,
title = {SpeechCLIP: Integrating Speech with Pre-Trained Vision and Language Model},
author = {Yi-Jen Shih and Hsuan-Fu Wang and Heng-Jui Chang and Layne Berry and Hung-yi Lee and David Harwath},
journal= {arXiv preprint arXiv:2210.00705},
year = {2022}
}
备注
Accepted to IEEE SLT 2022