中文

γ-MoD:探索多模态大语言模型的混合深度适配

计算机视觉与模式识别 2024-10-18 v1

摘要

尽管多模态大语言模型(MLLMs)取得了显著进展,但其高昂的计算成本仍然是实际部署的障碍。受自然语言处理中混合深度(MoDs)的启发,我们从“激活令牌”的角度来解决这一限制。我们的关键见解是,如果大多数令牌对于层计算是冗余的,那么可以通过MoD层直接跳过它们。然而,直接将MLLMs的密集层转换为MoD层会导致性能大幅下降。为了解决这个问题,我们为现有MLLMs提出了一种创新的MoD适配策略,称为γ-MoD。在γ-MoD中,提出了一种新的度量标准来指导MoD在MLLM中的部署,即注意力图秩(ARank)。通过ARank,我们可以有效地识别哪些层是冗余的,应该被MoD层替换。基于ARank,我们进一步提出了两种新颖的设计,以最大化MLLM的计算稀疏性同时保持其性能,即共享视觉-语言路由器和掩码路由学习。通过这些设计,MLLM中超过90%的密集层可以有效地转换为MoD层。为了验证我们的方法,我们将其应用于三个流行的MLLM,并在9个基准数据集上进行了广泛的实验。实验结果不仅验证了γ-MoD对现有MLLM的显著效率提升,还证实了其在各种MLLM上的泛化能力。例如,在性能轻微下降(即-1.5%)的情况下,γ-MoD可以将LLaVA-HR的训练和推理时间分别减少31.0%和53.2%。

关键词

引用

@article{arxiv.2410.13859,
  title  = {$\gamma-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models},
  author = {Yaxin Luo and Gen Luo and Jiayi Ji and Yiyi Zhou and Xiaoshuai Sun and Zhiqiang Shen and Rongrong Ji},
  journal= {arXiv preprint arXiv:2410.13859},
  year   = {2024}
}