mBLIP:多语言视觉-大语言模型的高效引导
计算机视觉与模式识别
2024-06-21 v3 计算与语言
摘要
模块化视觉-语言模型(Vision-LLM)将预训练图像编码器与(冻结的)大语言模型(LLM)对齐,并事后调节 LLM 以“理解”图像输入。鉴于现成的高质量英文图文数据以及强大的英文单语 LLM 的丰富性,研究焦点一直集中于仅英文的 Vision-LLM。多语言视觉-语言模型仍主要通过昂贵端到端预训练获得,导致模型相对较小,且在有限多语言图像数据辅以纯文本多语言语料上训练。我们提出 mBLIP,首个利用多语言 LLM 的 Vision-LLM,并以计算高效方式在消费级硬件上获得。为此,我们使用仅数百万从视觉与语言任务混合中衍生的多语言训练样本,将先前调优至英文 LLM 的图像编码器重新对齐至新的多语言 LLM,这些样本通过将高质量英文数据机器翻译为 95 种语言得到。在 IGLUE 基准与 XM3600 上,mBLIP 取得与最先进模型相竞争的结果,并大幅优于如 Llava 1.5 等强仅英文 Vision-LLM。我们在 \url{https://github.com/gregor-ge/mBLIP} 发布模型、代码与训练数据。
引用
@article{arxiv.2307.06930,
title = {mBLIP: Efficient Bootstrapping of Multilingual Vision-LLMs},
author = {Gregor Geigle and Abhay Jain and Radu Timofte and Goran Glavaš},
journal= {arXiv preprint arXiv:2307.06930},
year = {2024}
}
备注
ALVR Workshop 2024