中文

FlexVAR:无残差预测的灵活视觉自回归建模

计算机视觉与模式识别 2026-01-13 v2

摘要

本 work 挑战了视觉自回归建模中的残差预测范式,提出了 FlexVAR:一种新的灵活视觉自回归图像生成范式。FlexVAR 通过基于真实数据的自回归学习,使每一步都能独立生成合理的图像。这种简单直观的方法能够迅速学习视觉分布,使生成过程更加灵活和可适应。仅凭低分辨率图像(\leq 256px)训练的 FlexVAR 能:(1)生成各种分辨率和宽高比的图像,甚至超过训练图像的分辨率;(2)支持各种图像到图像任务,包括图像细化、内外插补和图像扩展;(3)适应各种自回归步骤,允许通过减少步骤实现更快的推理,或通过增加步骤提升图像质量。我们 10 亿参数模型在 ImageNet 256×\times256 基准上超越了其 VAR 同类模型。此外,当以零样本方式进行图像生成,仅需 13 步,性能提升至 2.08 FID,超越了 AiM/VAR 等最新自回归模型和流行扩散模型 LDM/DiT 的 0.25/0.28 FID 和 1.52/0.19 FID。当将我们的 10 亿参数模型以零样本方式迁移至 ImageNet 512×\times512 基准时,FlexVAR 能在 VAR 23 亿参数模型(完全监督模型,训练于 512×\times512 分辨率)中实现具有竞争力的结果。

关键词

引用

@article{arxiv.2502.20313,
  title  = {FlexVAR: Flexible Visual Autoregressive Modeling without Residual Prediction},
  author = {Siyu Jiao and Gengwei Zhang and Yinlong Qian and Jiancheng Huang and Yao Zhao and Humphrey Shi and Lin Ma and Yunchao Wei and Zequn Jie},
  journal= {arXiv preprint arXiv:2502.20313},
  year   = {2026}
}