中文

邻近自回归建模:高效视觉生成

计算机视觉与模式识别 2025-03-17 v1 图像与视频处理

摘要

视觉自回归模型通常遵循光栅顺序的“下一个标记预测”范式,忽略了视觉内容中固有的空间和时间局部性。具体而言,视觉标记与其空间或时间相邻的标记之间的关联显著强于与远距离标记的关联。本文提出了邻近自回归建模(Neighboring Autoregressive Modeling, NAR),一种新型范式,将视觉生成表述为逐步填充的过程,遵循“从近及远的下一个邻居预测”机制。从初始标记开始,其余标记按其在空间-时间空间中相对于初始标记的曼哈顿距离升序解码,逐步扩大已解码区域的边界。为实现对空间-时间内多个相邻标记的并行预测,我们引入一组维度导向的解码头,每组预测关键维度上下一个标记。推理期间,所有相邻于已解码标记的标记将并行处理,从而大幅减少生成的模型前向步骤。在 ImageNet256×256256\times256 和 UCF101 上的实验表明,NAR 分别实现了 2.4×2.4\times8.6×8.6\times 的更高吞吐量,同时在图像和视频生成任务中获得更好的 FID/FVD 分数。评估于 GenEval 的文本到图像生成基准时,参数量为 0.8B 的 NAR 在仅使用 0.4 训练数据的条件下超越了 Chameleon-7B。代码已公开于 https://github.com/ThisisBillhe/NAR。

关键词

引用

@article{arxiv.2503.10696,
  title  = {Neighboring Autoregressive Modeling for Efficient Visual Generation},
  author = {Yefei He and Yuanyu He and Shaoxuan He and Feng Chen and Hong Zhou and Kaipeng Zhang and Bohan Zhuang},
  journal= {arXiv preprint arXiv:2503.10696},
  year   = {2025}
}

备注

16 pages