ActVAR:用于高效视觉自回归生成的激活混合权重与标记
计算机视觉与模式识别
2025-11-18 v1
摘要
视觉自回归(VAR)模型通过下一尺度预测实现高效图像生成,但随着序列长度增长,其计算成本也随之升高。现有的静态剪枝方法通过永久性移除权重或标记来降低性能,破坏了预训练的依赖关系。为此,本文提出 ActVAR,一种动态激活框架,引入权重和标记序列双稀疏性以提升效率而不牺牲容量。ActVAR 将前馈网络(FFN)分解为轻量级专家子网络,运用可学习路由器基于内容动态选择特定标记的专家子集。同时,一个门控标记选择器识别出高更新潜力的标记进行计算,同时重建未选择的标记以保持全局语境和序列对齐。训练采用两阶段知识蒸馏策略,原始 VAR 模型监督路由和门控策略的学习,以与预训练知识对齐。在 ImageNet 基准测试上进行实验,表明 ActVAR 在 FLOPs 降低最高可达 的同时,性能下降最小。
引用
@article{arxiv.2511.12893,
title = {ActVAR: Activating Mixtures of Weights and Tokens for Efficient Visual Autoregressive Generation},
author = {Kaixin Zhang and Ruiqing Yang and Yuan Zhang and Shan You and Tao Huang},
journal= {arXiv preprint arXiv:2511.12893},
year = {2025}
}