面向视觉自回归模型的动态混合专家
计算机视觉与模式识别
2026-03-17 v2
摘要
视觉自回归模型(VAR)提供了高效且高质量的图像生成,但因在递增分辨率下重复调用Transformer而产生计算冗余。我们引入一种集成到VAR中的动态混合专家路由器。新型架构允许通过比例感知阈值在计算与质量之间进行权衡。这种阈值策略基于token复杂度和分辨率进行专家选择,而无需额外训练。结果我们实现了20%更少的浮点运算、11%更快的推理速度,并保持与稠密基线相同的图像质量。
引用
@article{arxiv.2510.08629,
title = {Dynamic Mixture-of-Experts for Visual Autoregressive Model},
author = {Jort Vincenti and Metod Jazbec and Guoxuan Xia},
journal= {arXiv preprint arXiv:2510.08629},
year = {2026}
}