中文

基于后注入、凹锥修剪和早期退出的 MLLM 层次化视觉标记降低

计算机视觉与模式识别 2026-03-02 v1 计算与语言

摘要

处理 MLLM(多模态大语言模型)中的视觉标记的二次计算成本阻碍了其广泛采用。虽然渐进式视觉标记修剪提供了可行的解决方案,但当前方法误解了浅层层的功能,并采用刚性计划,无法发挥出完整的效率潜力。为此,我们提出 HiDrop 框架,将标记修剪与 MLLM 层的真实层次功能对齐。HiDrop 的两个关键创新点包括:(1)后注入(Late Injection),绕过被动浅层层,在活跃融合开始的地方精确引入视觉标记;(2)凹锥修剪(Concave Pyramid Pruning)结合早期退出(Early Exit)机制,以动态调整中层和深层的修剪率。这一过程通过基于层间相似性度量和可微分 top-k 算子进行优化。为确保实际效率,HiDrop 还包括持久位置编码、兼容 FlashAttention 的标记选择,以及视觉计算的并行解耦,以消除动态标记降低所隐藏的开销。广泛实验表明,HiDrop 可压缩约 90% 的视觉标记,同时保持原始性能,训练加速 1.72 倍。我们的工作不仅为高效 MLLM 训练和推理树立了新的 SOTA,也提供了关于多模态融合层次性的宝贵见解。代码已发布于 https://github.com/EIT-NLP/HiDrop。

关键词

引用

@article{arxiv.2602.23699,
  title  = {HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit},
  author = {Hao Wu and Yingqi Fan and Jinyang Dai and Junlong Tong and Yunpu Ma and Xiaoyu Shen},
  journal= {arXiv preprint arXiv:2602.23699},
  year   = {2026}
}

备注

Accepted to ICLR 2026