中文

用于高效视觉自回归建模的图像扩展学习

计算机视觉与模式识别 2025-11-20 v1

摘要

自回归模型最近在视觉生成中显示出巨大的潜力,因其利用类似语言建模的离散标记序列。然而,现有方法常因逐标记解码或多尺度表示的复杂性而效率低下。本文引入了Expanding Autoregressive Representation (EAR),一种新颖的生成范式,模拟了人类视觉系统中心向外的感知模式。EAR沿螺旋顺序从中心展开图像标记,并逐渐向外扩展,保持空间连续性,实现高效并行解码。为进一步提升灵活性和速度,我们提出了长度自适应解码策略,可动态调整每一步预测的标记数量。这种生物学启发的设计不仅降低了计算成本,还通过将生成顺序与感知相关性匹配,提高了生成质量。在ImageNet上进行的大量实验表明,EAR在单尺度自回归模型中实现了保真度与效率之间的突破性平衡,为可扩展且符合认知规律的自回归图像生成开辟了新方向。

关键词

引用

@article{arxiv.2511.15499,
  title  = {Learning to Expand Images for Efficient Visual Autoregressive Modeling},
  author = {Ruiqing Yang and Kaixin Zhang and Zheng Zhang and Shan You and Tao Huang},
  journal= {arXiv preprint arXiv:2511.15499},
  year   = {2025}
}

备注

16 pages, 18 figures, includes appendix with additional visualizations, submitted as arXiv preprint