中文

ReGATE:在多模态大语言模型中以更少 Token 实现更快更优的学习

计算机视觉与模式识别 2026-04-30 v3 计算与语言

摘要

训练多模态大语言模型(MLLM)的计算成本随所处理 Token 数量的增加而快速增长。现有的效率方法主要针对推理阶段,通过 Token 缩减或合并来加速,对训练的收益有限。本文提出 ReGATE(Reference-Guided Adaptive Token Elision,参考引导的自适应 Token 剪除),一种用于加速 MLLM 训练的自适应 Token 剪枝方法。ReGATE 采用师生框架,其中冻结的教师 LLM 提供逐 Token 的参考损失,并与学生难度估计的指数移动平均相融合。该自适应评分机制在前向传播中动态选择信息量丰富的 Token,同时跳过冗余 Token,在不改变模型架构的前提下大幅降低计算量。在三个具有代表性的 MLLM 上,ReGATE 仅使用 38% 的 Token,即在 MVBench 上以最高 2 倍的速度达到标准训练的峰值准确率;在延长训练后,其在多个多模态基准上的表现甚至超越基线,总 Token 使用量减少超过 41%。

关键词

引用

@article{arxiv.2507.21420,
  title  = {ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs},
  author = {Chaoyu Li and Yogesh Kulkarni and Pooyan Fazli},
  journal= {arXiv preprint arXiv:2507.21420},
  year   = {2026}
}

备注

ACL 2026. Project page: https://people-robots.github.io/regate