马尔可夫尺度预测:视觉自回归生成的新时代
计算机视觉与模式识别
2026-03-04 v3
摘要
基于后尺度预测的视觉自回归模型(VAR)重新点燃了自回归式视觉生成的活力。尽管其完全上下文依赖——即对后续尺度预测建模的所有前置尺度——通过利用完整信息流促进了更稳定和全面的数据表示学习,但由此产生的计算效率低下和巨大开销严重阻碍了VAR的实用性和可扩展性。这促使我们开发一种在无完全上下文依赖下仍具备更好性能和效率的新型VAR模型。为此,我们将VAR重新表述为非完全上下文马尔可夫过程,提出Markov-VAR。通过马尔可夫尺度预测:我们将每个尺度视为马尔可夫状态,并引入滑动窗口将若干前置尺度压缩为紧凑的历史向量,以弥补因非完全上下文依赖而导致的历史信息损失。将历史向量与马尔可夫状态集成,即可得到在马尔可夫过程下的代表性动态状态。大量实验表明,Markov-VAR极其简单却高效:相较于VAR在ImageNet上的表现,Markov-VAR的FID降低10.5%(256×256),峰值内存消耗降低83.8%(1024×1024)。我们认为Markov-VAR可作为视觉自回归生成及其他下游任务未来研究的基础。
引用
@article{arxiv.2511.23334,
title = {Markovian Scale Prediction: A New Era of Visual Autoregressive Generation},
author = {Yu Zhang and Jingyi Liu and Yiwei Shi and Qi Zhang and Duoqian Miao and Changwei Wang and Longbing Cao},
journal= {arXiv preprint arXiv:2511.23334},
year = {2026}
}
备注
Accepted to CVPR 2026