中文

RandAR:随机顺序的解码器自回归视觉生成

计算机视觉与模式识别 2025-07-09 v2 人工智能

摘要

我们介绍RandAR,这是一种解码器自回归(AR)视觉模型,能够以任意 token 顺序生成图像。不同于依赖预定义生成顺序的以往解码器AR模型,RandAR消除了这种归纳偏差,开辟了解码器生成的新能力。我们的核心设计通过在要预测的每个图像 token 前插入一个“位置指令 token”来实现随机顺序,该指令代表下一个图像 token 的空间位置。使用随机排列的 token 序列进行训练——这比固定顺序生成更具挑战性——RandAR实现了与其常规 raster 顺序对手等性能。更重要的是,基于随机顺序训练的解码器变换器获得了新的能力。针对AR模型的效率瓶颈,RandAR在推理时采用并行解码配合KV-Cache,实现了2.5倍加速且不牺牲生成质量。此外,RandAR以零样本方式支持图像修补、扩展和分辨率外推。我们希望RandAR激发新的解码器视觉生成模型方向,拓宽其在多种场景中的应用。我们的项目页面位于https://rand-ar.github.io/。

关键词

引用

@article{arxiv.2412.01827,
  title  = {RandAR: Decoder-only Autoregressive Visual Generation in Random Orders},
  author = {Ziqi Pang and Tianyuan Zhang and Fujun Luan and Yunze Man and Hao Tan and Kai Zhang and William T. Freeman and Yu-Xiong Wang},
  journal= {arXiv preprint arXiv:2412.01827},
  year   = {2025}
}

备注

Project page: https://rand-ar.github.io/