中文

ActVAR:用于高效视觉自回归生成的激活混合权重与标记

计算机视觉与模式识别 2025-11-18 v1

摘要

视觉自回归(VAR)模型通过下一尺度预测实现高效图像生成,但随着序列长度增长,其计算成本也随之升高。现有的静态剪枝方法通过永久性移除权重或标记来降低性能,破坏了预训练的依赖关系。为此,本文提出 ActVAR,一种动态激活框架,引入权重和标记序列双稀疏性以提升效率而不牺牲容量。ActVAR 将前馈网络(FFN)分解为轻量级专家子网络,运用可学习路由器基于内容动态选择特定标记的专家子集。同时,一个门控标记选择器识别出高更新潜力的标记进行计算,同时重建未选择的标记以保持全局语境和序列对齐。训练采用两阶段知识蒸馏策略,原始 VAR 模型监督路由和门控策略的学习,以与预训练知识对齐。在 ImageNet 256×256256\times 256 基准测试上进行实验,表明 ActVAR 在 FLOPs 降低最高可达 21.2%21.2\% 的同时,性能下降最小。

关键词

引用

@article{arxiv.2511.12893,
  title  = {ActVAR: Activating Mixtures of Weights and Tokens for Efficient Visual Autoregressive Generation},
  author = {Kaixin Zhang and Ruiqing Yang and Yuan Zhang and Shan You and Tao Huang},
  journal= {arXiv preprint arXiv:2511.12893},
  year   = {2025}
}