Honeybee:面向多模态大语言模型的局部增强投影仪
计算机视觉与模式识别
2024-04-02 v2 人工智能
计算与语言
机器学习
摘要
在多模态大语言模型(MLLMs)中,视觉投影仪在连接预训练视觉编码器与LLM方面起着关键作用,能够在利用LLM强大能力的同时实现深刻的视觉理解。尽管视觉投影仪很重要,但对其研究相对较少。在本研究中,我们首先确定了投影仪的两个基本属性:(i)管理视觉令牌数量的灵活性,这对MLLM的整体效率至关重要;(ii)保留视觉特征的局部上下文,这对空间理解至关重要。基于这些发现,我们提出了一种新颖的投影仪设计,既灵活又增强了局部性,有效满足了这两个理想属性。此外,我们提出了有效利用多个和多方面指令数据集的综合策略。通过大量实验,我们检验了各个设计选择的影响。最后,我们提出的MLLM,Honeybee,在包括MME、MMBench、SEED-Bench和LLaVA-Bench在内的各种基准测试中显著优于先前的最先进方法,同时实现了更高的效率。代码和模型可在https://github.com/kakaobrain/honeybee获取。
引用
@article{arxiv.2312.06742,
title = {Honeybee: Locality-enhanced Projector for Multimodal LLM},
author = {Junbum Cha and Wooyoung Kang and Jonghwan Mun and Byungseok Roh},
journal= {arXiv preprint arXiv:2312.06742},
year = {2024}
}
备注
CVPR 2024 camera-ready