生成再重构:通过两阶段采样加速掩码自回归模型
计算机视觉与模式识别
2026-01-28 v2
摘要
掩码自回归 (MAR) 模型在并行生成方面比自回归 (AR) 模型更具效率优势,但其加速潜力仍受制于单一步骤中空间相关视觉标记建模复杂度。为解决这一限制,我们引入生成再重构 (GtR),这是一种无需训练的层次化采样策略,将生成分解为两个阶段:首先进行结构生成以建立全局语义框架,然后进行细节重构以高效完成剩余标记。我们假设从零创建一个图像的难度大于在基本图像框架上补全图像,因此 GtR 通过在生成阶段较慢地计算来维持生成质量,而在重构阶段快速计算,从而实现加速。此外,我们注意到图像细节区域的标记通常比显著区域的标记携带更多语义信息,进而提出频率加权标记选择 (FTS),基于高频信息能量对标记进行局部化,以向细节区域的标记分配更多计算资源。大量实验在 ImageNet 类别条件和文本到图像生成上表明,GtR 在 MAR-H 上实现了 3.72 倍的加速,同时保持相当的质量(例如 FID: 1.59,IS: 304.4 vs. 原版 1.59,299.1),在各种模型规模和生成任务中显著优于现有的加速方法。我们的代码将发布在 https://github.com/feihongyan1/GtR。
引用
@article{arxiv.2510.17171,
title = {Generation then Reconstruction: Accelerating Masked Autoregressive Models via Two-Stage Sampling},
author = {Feihong Yan and Peiru Wang and Yao Zhu and Kaiyu Pang and Qingyan Wei and Huiqi Li and Linfeng Zhang},
journal= {arXiv preprint arXiv:2510.17171},
year = {2026}
}
备注
12 pages, 6 figures