中文

DPAR:用于高效自回归视觉生成的动态分块化

计算机视觉与模式识别 2025-12-29 v1

摘要

纯解码器自回归图像生成通常依赖于固定长度的分词方案,其 token 数量随分辨率呈二次增长,大幅增加了注意力的计算和内存需求。我们提出了 DPAR,一种新颖的纯解码器自回归模型,该模型将图像 token 动态聚合为可变数量的 patch,以实现高效的图像生成。我们的工作首次证明,来自轻量级无监督自回归模型的下一 token 预测熵提供了一个可靠的准则,用于基于信息内容将 token 合并为更大的 patch。DPAR 对标准解码器架构进行了最小限度的修改,确保了与多模态生成框架的兼容性,并将更多计算资源分配给高信息量图像区域的生成。此外,我们证明,使用动态尺寸 patch 训练所产生的表示对 patch 边界具有鲁棒性,使得 DPAR 在推理时能够扩展到更大的 patch 尺寸。DPAR 在 Imagenet 256 和 384 生成分辨率下分别将 token 数量减少了 1.81 倍和 2.06 倍,导致训练成本中的 FLOPs 最多减少 40%。此外,我们的方法展现出更快的收敛速度,并且相对于基线模型将 FID 最多改善了 27.1%。

关键词

引用

@article{arxiv.2512.21867,
  title  = {DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation},
  author = {Divyansh Srivastava and Akshay Mehra and Pranav Maneriker and Debopam Sanyal and Vishnu Raj and Vijay Kamarshi and Fan Du and Joshua Kimball},
  journal= {arXiv preprint arXiv:2512.21867},
  year   = {2025}
}