E5-V:多模态大语言模型的通用嵌入
计算与语言
2024-07-18 v1 计算机视觉与模式识别
信息检索
摘要
多模态大语言模型(MLLMs)在通用视觉和语言理解方面显示出巨大的潜力。然而,利用 MLLMs 表示多模态信息的做法仍然大大未被探索。本 work 引入一种新框架 E5-V,旨在将 MLLMs 适用于实现通用多模态嵌入。我们的发现突显了 MLLMs 在表示多模态输入方面的巨大潜力,尤其是相较于以往方法。通过利用 MLLMs 配合提示词,E5-V 有效地弥合了不同类型输入之间的模态差距,展示了即使在无需微调的情况下,E5-V 在多模态嵌入方面也表现出强大的性能。我们提出了一种单模态训练方法,即仅使用文本配对训练 E5-V。该方法相较于传统基于图像-文本配对的多模态训练,在显著降低训练成本约95%的同时,实现了显著的性能提升。此外,该方法消除了对高成本多模态训练数据的收集需求。广泛的实验在四类任务中证明了 E5-V 的有效性。作为通用多模态模型,E5-V 不仅实现了,还经常在每个任务中超越了最先进的性能,尽管其仅基于单一模态训练。
引用
@article{arxiv.2407.12580,
title = {E5-V: Universal Embeddings with Multimodal Large Language Models},
author = {Ting Jiang and Minghui Song and Zihan Zhang and Haizhen Huang and Weiwei Deng and Feng Sun and Qi Zhang and Deqing Wang and Fuzhen Zhuang},
journal= {arXiv preprint arXiv:2407.12580},
year = {2024}
}
备注
Code and models are available at https://github.com/kongds/E5-V