中文

面向高效视觉自回归建模的渐进式 Supernet 训练

计算机视觉与模式识别 2025-11-21 v1

摘要

视觉自回归(VAR)模型通过“next-scale”预测范式显著减少推理步骤。然而,渐进式多尺度生成因累积的 KV 缓存而导致巨大的内存开销,限制了实际部署。我们观察到VAR中存在尺度-深度非对称依赖:早期尺度对网络深度极其敏感,而后期尺度对深度削减则保持稳健。基于此,我们提出VARiant:通过等距抽样,从原始30层VAR-d30网络中选择多个子网(层数从16到2层)。早期尺度由完整网络处理,后期尺度则采用子网。子网与完整网络共享权重,实现模型内部的灵活深度调整。然而,子网与整个网络之间的权重共享可能导致优化冲突。为此,我们提出一种渐进式训练策略,在固定比例训练下突破子网和完整网络生成质量的帕累托前沿,实现联合最优。在ImageNet上实验表明,与预训练的VAR-d30(FID 1.95)相比,VARiant-d16和VARiant-d8几乎等价的质量(FID 2.05/2.12),同时将内存消耗降低40%-65%。VARiant-d2实现了3.5倍的加速和80%的内存降低,仅在质量代价(FID 2.97)上有所牺牲。就部署而言,VARiant的单模型架构支持零成本运行时深度切换,提供从高质量到极致效率的灵活部署选项,满足不同应用场景的需求。

关键词

引用

@article{arxiv.2511.16546,
  title  = {Progressive Supernet Training for Efficient Visual Autoregressive Modeling},
  author = {Xiaoyue Chen and Yuling Shi and Kaiyuan Li and Huandong Wang and Yong Li and Xiaodong Gu and Xinlei Chen and Mingbao Lin},
  journal= {arXiv preprint arXiv:2511.16546},
  year   = {2025}
}

备注

Submitted to CVPR 2025. 10 pages, 7 figures