随机并行解码的自回归图像生成
计算机视觉与模式识别
2026-03-02 v5
摘要
我们提出了ARPG—a种新型视觉自回归模型,实现了随机并行生成,解决了常规栅格顺序方法固有的局限性,这些方法因其顺序、预定义的token生成顺序,限制了推理效率和零样本泛化。我们的关键洞察是,有效的随机顺序建模需要明确指导确定下一个预测token的位置。为此,我们提出了一种新的解耦解码框架,将位置指导与内容表征分离,分别编码为查询和键值对。通过直接将此指导纳入因果注意力机制,我们的方法实现了完全的随机顺序训练和生成,无需双向注意力。因此,ARPG能够轻松泛化到零样本任务,如图像填充、扩展和分辨率扩大。此外,它支持通过使用共享KV缓存并行处理多个查询来实现并行推理。在ImageNet-1K 256基准上,我们的方法仅需32个采样步骤即可实现FID 1.83,推理速度比规模相似的代表性最新自回归模型快30倍以上,内存消耗减少75%。
引用
@article{arxiv.2503.10568,
title = {Autoregressive Image Generation with Randomized Parallel Decoding},
author = {Haopeng Li and Jinyue Yang and Guoqi Li and Huan Wang},
journal= {arXiv preprint arXiv:2503.10568},
year = {2026}
}
备注
The Fourteenth International Conference on Learning Representations (ICLR 2026)