中文

FVAR:基于下一聚焦预测的视觉自回归建模

计算机视觉与模式识别 2025-11-25 v1

摘要

视觉自回归模型通过跨多尺度标记金字塔的下一尺度预测实现了卓越的生成质量。然而,传统方法使用均匀尺度下采样构建这些金字塔,导致出现别名伪影,损害细节并引入不必要的锯齿和莫尔纹。为解决此问题,本文提出 \textbf{FVAR},将范式从“下一尺度预测”重新框定为“下一聚焦预测”,模拟从模糊到清晰的自然相机聚焦过程。我们的方法引入了三个关键创新:\textbf{1) 下一聚焦预测范式} 通过逐步减少模糊度而非简单下采样来实现多尺度自回归;\textbf{2) 渐进式聚焦金字塔构建} 使用物理一致的散焦核构建干净、无别名的多尺度表示;\textbf{3) 高频残差学习} 采用专用残差教师网络在训练期间有效地整合别名信息,同时保持部署的简单性。具体而言,我们使用具有递减半径的散焦点扩散函数 (PSF) 核构建光学低通视图,创建从模糊到清晰的平滑过渡,源头消除别名。为进一步提升细节生成,我们引入高频残差教师,通过学习干净结构与别名残差来传授知识,最终蒸馏到用于无缝推理的基础 VAR 部署网络。在 ImageNet 上的大量实验表明,FVAR 显著减少别名伪影,改善细节保持,并提升文本可读性,同时实现卓越的性能,完美兼容现有的 VAR 框架。

关键词

引用

@article{arxiv.2511.18838,
  title  = {FVAR: Visual Autoregressive Modeling via Next Focus Prediction},
  author = {Xiaofan Li and Chenming Wu and Yanpeng Sun and Jiaming Zhou and Delin Qu and Yansong Qu and Weihao Bo and Haibao Yu and Dingkang Liang},
  journal= {arXiv preprint arXiv:2511.18838},
  year   = {2025}
}

备注

10 pages, 4 figures