FlashSloth:通过嵌入式视觉压缩实现闪电速度的多模态大语言模型
计算机视觉与模式识别
2024-12-06 v1
摘要
尽管多模态大语言模型(MLLM)在能力方面取得了巨大进步,但在实际使用中仍表现得像懒猫一样——响应慢、延迟大。近期的研究致力于构建微型 MLLM 以提升效率,但大量视觉 token 仍限制了实际加速效果。本文提出一种强大且快速的微型 MLLM,名为 FlashSloth。与前述工作不同,FlashSloth 专注于提高视觉 token 在压缩冗余语义过程中的描述能力。具体而言,FlashSloth 引入嵌入式视觉压缩设计,捕获视觉显著信息和指令相关图像信息,从而以更少的视觉 token 实现卓越的多模态性能。对 FlashSloth 进行了大量实验验证,并全面比较了众多微型且强大的 MLLM,如 InternVL2、MiniCPM-V2 和 Qwen2-VL。实验结果表明,与这些先进的微型 MLLM 相比,FlashSloth 能显著减少视觉 token 数量、训练内存和计算复杂度,同时在各种视觉-语言任务中保持高性能。
关键词
引用
@article{arxiv.2412.04317,
title = {FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression},
author = {Bo Tong and Bokai Lai and Yiyi Zhou and Gen Luo and Yunhang Shen and Ke Li and Xiaoshuai Sun and Rongrong Ji},
journal= {arXiv preprint arXiv:2412.04317},
year = {2024}
}