M-SpeechCLIP:利用大规模预训练模型实现多语言语音到图像检索
计算与语言
2023-04-11 v2 声音
音频与语音处理
摘要
本工作研究利用大规模仅英文预训练模型(CLIP 与 HuBERT)进行多语言图像-语音检索。对于非英文图像-语音检索,无论为每种语言训练单独模型,还是使用处理三种语言语音的单一模型,我们都大幅超越了当前最优性能。我们识别出英文与非英文设定下模型行为与性能的关键差异,这些差异归因于 CLIP 与 HuBERT 的仅英文预训练,并探究微调预训练模型如何影响这些差异。最后,我们表明我们的模型可用于单语言与跨语言语音-文本检索以及跨语言语音-语音检索,尽管训练期间从未见过任何并行语音-文本或语音-语音数据。
引用
@article{arxiv.2211.01180,
title = {M-SpeechCLIP: Leveraging Large-Scale, Pre-Trained Models for Multilingual Speech to Image Retrieval},
author = {Layne Berry and Yi-Jen Shih and Hsuan-Fu Wang and Heng-Jui Chang and Hung-yi Lee and David Harwath},
journal= {arXiv preprint arXiv:2211.01180},
year = {2023}
}
备注
Accepted to ICASSP 2023