多尺度自回归模型是拉普拉斯、离散与潜在扩散模型的变形
机器学习
2026-02-17 v2
摘要
我们重新诠释视觉自回归(VAR)模型作为迭代细化模型,以识别驱动其质量-效率权衡的设计选择。本文不将 VAR 仅仅视为尺度-后自回归,而是将其形式化为确定性前向过程,通过构建拉普拉斯式潜在金字塔,并伴随学习的反向过程在少量粗到细步骤中重构样本。这种表述使扩散模型的链接变得显式,并突出了可能支撑 VAR 效率和样本质量的三个建模选择:在学习潜在空间中的细化、对代码指数进行离散预测、以及按空间频率分解。我们通过控制实验支持这一观点,分别隔离每个因素对质量和速度的贡献。我们还讨论了同一框架如何适用于不变排列图的生成以及概率中期天气预报,并指出它在保持少量步骤、尺度并行生成的同时,为扩散方法提供了实用的接触点。
引用
@article{arxiv.2510.02826,
title = {Multi-scale Autoregressive Models are Laplacian, Discrete, and Latent Diffusion Models in Disguise},
author = {Steve Hong and Samuel Belkadi},
journal= {arXiv preprint arXiv:2510.02826},
year = {2026}
}