中文

FlashSloth:通过嵌入式视觉压缩实现闪电速度的多模态大语言模型

计算机视觉与模式识别 2024-12-06 v1

摘要

尽管多模态大语言模型(MLLM)在能力方面取得了巨大进步,但在实际使用中仍表现得像懒猫一样——响应慢、延迟大。近期的研究致力于构建微型 MLLM 以提升效率,但大量视觉 token 仍限制了实际加速效果。本文提出一种强大且快速的微型 MLLM,名为 FlashSloth。与前述工作不同,FlashSloth 专注于提高视觉 token 在压缩冗余语义过程中的描述能力。具体而言,FlashSloth 引入嵌入式视觉压缩设计,捕获视觉显著信息和指令相关图像信息,从而以更少的视觉 token 实现卓越的多模态性能。对 FlashSloth 进行了大量实验验证,并全面比较了众多微型且强大的 MLLM,如 InternVL2、MiniCPM-V2 和 Qwen2-VL。实验结果表明,与这些先进的微型 MLLM 相比,FlashSloth 能显著减少视觉 token 数量、训练内存和计算复杂度,同时在各种视觉-语言任务中保持高性能。

关键词

引用

@article{arxiv.2412.04317,
  title  = {FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression},
  author = {Bo Tong and Bokai Lai and Yiyi Zhou and Gen Luo and Yunhang Shen and Ke Li and Xiaoshuai Sun and Rongrong Ji},
  journal= {arXiv preprint arXiv:2412.04317},
  year   = {2024}
}