中文

MaMe 与 MaRe:基于矩阵的令牌合并与恢复,用于高效视觉感知与合成

计算机视觉与模式识别 2026-04-16 v1 人工智能

摘要

令牌压缩是缓解视觉 Transformer (ViT) 中自注意力机制二次复杂度的关键手段,常涉及大量输入令牌。现有方法如 ToMe 依赖 GPU 低效操作(如排序、散列写入),引入开销限制其效果。我们提出 MaMe,一种完全基于矩阵运算的、无训练、可微分的令牌合并方法,GPU 友好可加速 ViT。此外,我们提出 MaRe,其为 MaMe 的逆运算,构成用于图像合成的 MaMe+MaRe 流水线。在预训练模型上应用时,MaMe 可使 ViT-B 吞吐量提升 2 倍,仅产生 2% 的精度下降。值得注意的是,使用 MaMe 对最后一层进行微调可在 1.1 倍速度下提升 ViT-B 精度 1.0%。在 SigLIP2-B@512 零样本分类中,MaMe 提供 1.3 倍加速,性能几乎不受影响。在视频任务中,MaMe 将 VideoMAE-L 在 Kinetics-400 上的加速 48.5%,仅损失 0.84% 的精度。此外,MaMe 在某些任务上实现性能与速度的同步提升。在图像合成中,MaMe+MaRe 流水线在降低 31% 的 Stable Diffusion v2.1 生成延迟的同时提升质量。总体而言,这些结果表明 MaMe 与 MaRe 在加速视觉模型方面具有有效性。代码可在 https://github.com/cominder/mame 获得。

关键词

引用

@article{arxiv.2604.13432,
  title  = {MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis},
  author = {Simin Huo and Ning Li},
  journal= {arXiv preprint arXiv:2604.13432},
  year   = {2026}
}

备注

20 pages. Extended version of CVPR 2026 Findings paper. Neurocomputing (Elsevier) under review