中文

LLaVA-MORE:用于增强视觉指令微调的 LLM 与视觉骨干网络的比较研究

计算机视觉与模式识别 2025-08-01 v2 人工智能 计算与语言 多媒体

摘要

多模态大语言模型(MLLM)领域的最新进展凸显了视觉骨干网络和底层语言模型的关键作用。虽然先前工作主要关注将这些组件扩展到数十亿参数,但模型规模、架构和性能之间的权衡仍未被充分探索。此外,训练数据和评估协议的不一致阻碍了直接比较,使得难以得出最优设计选择。在本文中,我们引入了 LLaVA-MORE,一个新的 MLLM 家族,将最近的语言模型与多样化的视觉骨干网络相结合。为确保公平比较,我们在所有架构上采用统一的训练协议。我们的分析系统地探索了小规模和中规模 LLM——包括 Phi-4、LLaMA-3.1 和 Gemma-2——以评估多模态推理、生成和指令遵循,同时考察模型规模与性能之间的关系。除了评估 LLM 对最终结果的影响外,我们还全面研究了各种视觉编码器,范围涵盖基于 CLIP 的架构以及 DINOv2、SigLIP 和 SigLIP2 等替代方案。额外实验研究了提高图像分辨率和变化预训练数据集的影响。总体而言,我们的结果为设计更有效的 MLLM 提供了见解,提供了一个可复现的评估框架,促进直接比较并可指导未来模型开发。我们的源代码和训练模型公开可用,地址为:https://github.com/aimagelab/LLaVA-MORE。

关键词

引用

@article{arxiv.2503.15621,
  title  = {LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning},
  author = {Federico Cocchi and Nicholas Moratelli and Davide Caffagni and Sara Sarto and Lorenzo Baraldi and Marcella Cornia and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2503.15621},
  year   = {2025}
}

备注

ICCV 2025 Workshop on What is Next in Multimodal Foundation Models