MoAI:面向大语言与视觉模型的混合全能智能
计算机视觉与模式识别
2024-07-18 v3
摘要
大语言模型(LLM)和指令调优的兴起,推动了当前关于指令调优型大语言与视觉模型(LLVM)的趋势。这一趋势要么通过精心策划针对特定目标的众多指令调优数据集,要么通过扩大 LLVM 以管理大量视觉语言(VL)数据。然而,当前的 LLVM 忽略了来自专门计算机视觉(CV)模型在视觉感知任务中(如分割、检测、场景图生成(SGG)和光学字符识别(OCR))所获得的详细且全面的真实场景理解。相反,现有的 LLVM 主要依赖其 LLM 背板的大容量和涌现能力。因此,我们提出了一种新的 LLVM,称为混合全能智能(Mixture of All Intelligence, MoAI),它利用来自外部分割、检测、SGG 和 OCR 模型输出的辅助视觉信息。MoAI 通过两种新引入的模块运行:MoAI-Compressor 和 MoAI-Mixer。经过 verbalize 处理后,MoAI-Compressor 对齐并压缩这些外部 CV 模型的输出,以高效地利用相关的辅助视觉信息用于 VL 任务。MoAI-Mixer then 通过混合专家(Mixture of Experts)的概念,将三种类型的智能(1)视觉特征,(2)来自外部 CV 模型的辅助特征,和(3)语言特征进行融合。通过这种集成,MoAI 在诸多零样本 VL 任务中显著优于开源和闭源 LLVM,尤其是那些涉及真实场景理解的任务,如物体存在、位置、关系和 OCR,而无需扩大模型规模或策划额外的视觉指令调优数据集。
引用
@article{arxiv.2403.07508,
title = {MoAI: Mixture of All Intelligence for Large Language and Vision Models},
author = {Byung-Kwan Lee and Beomchan Park and Chae Won Kim and Yong Man Ro},
journal= {arXiv preprint arXiv:2403.07508},
year = {2024}
}
备注
ECCV 2024. Code available: https://github.com/ByungKwanLee/MoAI