中文

Honeybee:面向多模态大语言模型的局部增强投影仪

计算机视觉与模式识别 2024-04-02 v2 人工智能 计算与语言 机器学习

摘要

在多模态大语言模型(MLLMs)中,视觉投影仪在连接预训练视觉编码器与LLM方面起着关键作用,能够在利用LLM强大能力的同时实现深刻的视觉理解。尽管视觉投影仪很重要,但对其研究相对较少。在本研究中,我们首先确定了投影仪的两个基本属性:(i)管理视觉令牌数量的灵活性,这对MLLM的整体效率至关重要;(ii)保留视觉特征的局部上下文,这对空间理解至关重要。基于这些发现,我们提出了一种新颖的投影仪设计,既灵活又增强了局部性,有效满足了这两个理想属性。此外,我们提出了有效利用多个和多方面指令数据集的综合策略。通过大量实验,我们检验了各个设计选择的影响。最后,我们提出的MLLM,Honeybee,在包括MME、MMBench、SEED-Bench和LLaVA-Bench在内的各种基准测试中显著优于先前的最先进方法,同时实现了更高的效率。代码和模型可在https://github.com/kakaobrain/honeybee获取。

关键词

引用

@article{arxiv.2312.06742,
  title  = {Honeybee: Locality-enhanced Projector for Multimodal LLM},
  author = {Junbum Cha and Wooyoung Kang and Jonghwan Mun and Byungseok Roh},
  journal= {arXiv preprint arXiv:2312.06742},
  year   = {2024}
}

备注

CVPR 2024 camera-ready