中文

高效多模态大语言模型的动态金字塔网络

计算机视觉与模式识别 2026-02-05 v3

摘要

多模态大语言模型(MLLM)在 various vision-language(VL)任务中展现了惊人的性能,但其高昂的计算成本仍限制了实际应用。为此,近期研究者致力于压缩视觉特征以节省 MLLM 的计算成本。然而,direct visual compression 方法(如 efficient projectors)不可避免地会破坏 MLLM 中的视觉语义,尤其是在困难样本上。为克服这一不足,我们提出了一种新型动态金字塔网络(DPN)用于高效 MLLM。具体而言,DPN 将 MLLM 表述为层次结构,其中视觉特征随着深度逐渐被压缩。在这种情况下,尽管压缩比例很高,浅层仍可感知到细粒度的视觉信息。为最大化 DPN 的效益,我们进一步提出了一种创新的 Dynamic Pooling Experts(DPE),可根据输入特征动态选择最佳视觉压缩率。通过此设计,较难的样本将被分配更大的计算资源,从而保留模型性能。为验证我们的 方法,我们在两个流行的 MLLM 上进行了大量基准测试。实验结果表明,DPN 在 LLaVA 上可节省最高 56% 的平均 FLOPs,同时进一步实现 +0.74% 的性能提升。此外,DPN 在现有的高分辨率 MLLM(如 LLaVA-HR)上的泛化能力也得到验证。源代码将在 https://github.com/aihao2000/DPN-LLaVA 发布。

关键词

引用

@article{arxiv.2503.20322,
  title  = {Dynamic Pyramid Network for Efficient Multimodal Large Language Model},
  author = {Hao Ai and Kunyi Wang and Zezhou Wang and Hao Lu and Jin Tian and Yaxin Luo and Peng Xing and Jen-Yuan Huang and Huaxia Li and Gen luo},
  journal= {arXiv preprint arXiv:2503.20322},
  year   = {2026}
}