中文

p-MoD:基于渐进比例衰减构建混合深度模型

计算机视觉与模式识别 2025-08-07 v2 计算与语言

摘要

尽管多模态大语言模型(Multimodal Large Language Models, MLLMs)在多样化任务上表现卓越,但巨大的训练和推理成本仍制约其发展。本文提出 p-MoD,一种高效 MLLM 架构,显著降低训练和推理成本,同时保持模型性能。MLLM 的计算主要来源于由基于转换器的 LLM 处理的大量视觉 token 所致。因此,我们利用混合深度(Mixture-of-Depths, MoD)机制,使每个 LLM 层选择处理必需的视觉 token 以处理,同时跳过冗余的 token。然而,将 MoD 集成到 MLLM 中并非易事。为解决训练和推理稳定性差以及训练数据有限的挑战,我们采用两种新颖设计:tanh-gated 权重归一化(TanhNorm)和对称 token 重加权(STRing)。此外,我们观察到视觉 token 在更深的层中具有更高的冗余性,因而设计了渐进比例衰减(Progressive Ratio Decay, PRD)策略,该策略逐层逐渐降低 token 保留比例,采用偏移余弦计划。以上的关键设计充分释放了 MoD 的潜力,显著提升了模型的效率和性能。广泛的实验在两个基线模型上进行,覆盖 15 个基准测试,表明我们的模型在相应基线模型的性能上匹配甚至超越,同时在推理时仅需 55.6% 的 TFLOPs 和 53.7% 的 KV 缓存存储,在训练时仅需 77.7% 的 GPU 小时。

关键词

引用

@article{arxiv.2412.04449,
  title  = {p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay},
  author = {Jun Zhang and Desen Meng and Zhengming Zhang and Zhenpeng Huang and Tao Wu and Limin Wang},
  journal= {arXiv preprint arXiv:2412.04449},
  year   = {2025}
}

备注

Accepted by ICCV 2025; Code released at https://github.com/MCG-NJU/p-MoD