多模态大语言模型中连接器选择的深度研究:保存与压缩的权衡
计算与语言
2024-10-10 v1 计算机视觉与模式识别
摘要
近年来,多模态大语言模型(MLLM)因其在行业和学术界的广泛关注而备受关注。然而,关于构建 MLLM 架构特别是为不同粒度的感知任务选择合适连接器仍存 considerable争议。本文系统性地研究了连接器对 MLLM 性能的影响。具体而言,我们将连接器分为特征保存型和特征压缩型。利用统一的分类标准,我们将来自三个全面基准(MMBench、MME 和 SEED-Bench)中的子任务分为三类任务类型:粗粒度感知、细粒度感知和推理,并对其性能进行评估。我们的发现表明,特征保存型连接器因其能够保留详细视觉信息而在细粒度感知任务中表现突出。相比之下,特征压缩型连接器虽在细粒度感知任务中效果较差,但在速度上具有显著优势,在粗粒度感知和推理任务中性能相当。这些见解对于指导 MLLM 架构设计和推进 MLLM 架构优化具有重要意义。
引用
@article{arxiv.2410.06765,
title = {To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models},
author = {Junyan Lin and Haoran Chen and Dawei Zhu and Xiaoyu Shen},
journal= {arXiv preprint arXiv:2410.06765},
year = {2024}
}
备注
Accepted to EMNLP 2024 Main Conference