基准测试大型和小型多模态语言模型
计算机视觉与模式识别
2025-01-09 v1
摘要
大型多模态语言模型(MLLMs)如 GPT-4V 和 GPT-4o 已在理解和生成多模态内容方面取得了显著进展,展现出优越的质量和能力,涵盖多样化任务。然而,它们的部署面临显著挑战,包括推理速度慢、计算成本高以及不适用于嵌入式应用。相比之下,以 LLava 系列模型和 Phi-3-Vision 为代表的小型 MLLMs 提供了具有快速推理、降低部署成本以及能够处理特定领域情境的有前景的替代方案。尽管它们日益增长的存在,但大型和小型 MLLMs 之间的能力边界仍未得到充分探索。在本工作中,我们进行了一项系统性和全面的评估,以对标大型和小型 MLLMs,涵盖诸如对象识别、时间推理和多模态理解等通用能力,以及面向行业和汽车等实际应用领域的情境。我们的评估显示,小型 MLLMs 在特定情境下可以实现与大型模型相当的性能,但在需要深层推理或细致理解的复杂任务中显著落后。此外,我们确定了大型和小型 MLLMs 中的常见失败案例,突出了即使是最先进的模型在哪些领域仍感到挑战。我们希望我们的发现将指导研究社区推动 MLLMs 的质量边界,推动其在不同应用中的可用性和有效性。
引用
@article{arxiv.2501.04150,
title = {Benchmarking Large and Small MLLMs},
author = {Xuelu Feng and Yunsheng Li and Dongdong Chen and Mei Gao and Mengchen Liu and Junsong Yuan and Chunming Qiao},
journal= {arXiv preprint arXiv:2501.04150},
year = {2025}
}