Eve:具有弹性视觉专家的高效多模态视觉语言模型
计算机视觉与模式识别
2025-01-24 v2
摘要
随着模型规模和数据量的不断增长,多模态视觉语言模型(VLM)取得了显著进展。在边缘设备上运行VLM已成为其广泛应用的挑战。虽然已有多种高效VLM方法,但它们往往以牺牲语言能力来增强多模态能力,或需要大量训练。为此,我们引入了创新的框架:具有弹性视觉专家的高效视觉语言模型(Eve)。通过战略性地在多个训练阶段融入可调整的视觉专业知识,Eve在保持语言能力的同时增强了多模态能力。这种平衡的方法导致了一个仅需18亿参数的 versatile model,在语言和多模态任务上均取得显著改进。值得注意的是,在参数数量低于30亿的配置中,Eve在语言基准测试中显著领先,并在VLM基准测试中实现最先进的结果68.87%。此外,其多模态准确率甚至超过了更大规模的70亿参数 LLaVA-1.5 model。我们的代码已公开 https://github.com/rangmiao/Eve。
引用
@article{arxiv.2501.04322,
title = {Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts},
author = {Miao Rang and Zhenni Bi and Chuanjian Liu and Yehui Tang and Kai Han and Yunhe Wang},
journal= {arXiv preprint arXiv:2501.04322},
year = {2025}
}