CLASP:用于多语言多模态信息检索的对比语言-语音预训练
计算与语言
2025-03-25 v2 信息检索
声音
音频与语音处理
摘要
本研究引入了 CLASP(Contrastive Language-Speech Pretraining),一种专为音频-文本信息检索量身定制的多语言、多模态表示。CLASP 利用了语音内容与文本数据之间的协同作用。在训练期间,我们利用了新引入的语音-文本数据集,该数据集涵盖了从小说到宗教等 15 个不同类别。CLASP 的音频组件将音频频谱图与预训练的自监督语音模型相集成,而其语言编码对应部分则采用了在超过 100 种语言上预训练的句子编码器。这种统一的轻量级模型弥合了各种模态和语言之间的差距,增强了其处理和检索多语言及多模态数据的有效性。我们在多种语言上的评估表明,CLASP 在 HITS@1、MRR 和 meanR 指标上确立了新的基准,优于传统的基于 ASR 的检索方法(此类方法依赖将语音转录为文本以进行后续文本检索),尤其是在特定场景下。
引用
@article{arxiv.2412.13071,
title = {CLASP: Contrastive Language-Speech Pretraining for Multilingual Multimodal Information Retrieval},
author = {Mohammad Mahdi Abootorabi and Ehsaneddin Asgari},
journal= {arXiv preprint arXiv:2412.13071},
year = {2025}
}
备注
accepted at ECIR 2025, 13 pages, 4 figures