将LLM转化为跨模态和跨语言检索系统
计算与语言
2024-07-11 v3 信息检索
声音
音频与语音处理
摘要
大型语言模型(LLM)在仅文本数据上训练,这些数据远远超出了具有配对语音和文本数据的语言。同时,基于双编码器(DE)的检索系统将查询和文档投影到相同的嵌入空间中,并在检索和双语文本挖掘中展示了其成功。为了匹配多种语言的语音和文本,我们提出使用LLM初始化多模态DE检索系统。与传统方法不同,我们的系统在LLM预训练期间不需要语音数据,并且可以利用LLM的多语言文本理解能力来匹配检索训练中未见语言的语音和文本。我们的基于多模态LLM的检索系统能够匹配102种语言的语音和文本,尽管仅训练了21种语言。我们的系统优于先前在所有102种语言上显式训练的系统。我们在这些语言上平均实现了Recall@1的10%绝对提升。此外,我们的模型展示了跨语言语音和文本匹配,这通过现成的机器翻译数据进一步增强。
引用
@article{arxiv.2404.01616,
title = {Transforming LLMs into Cross-modal and Cross-lingual Retrieval Systems},
author = {Frank Palma Gomez and Ramon Sanabria and Yun-hsuan Sung and Daniel Cer and Siddharth Dalmia and Gustavo Hernandez Abrego},
journal= {arXiv preprint arXiv:2404.01616},
year = {2024}
}