自回归图像生成仅需少量缓存行的标记
计算机视觉与模式识别
2025-12-05 v1
摘要
自回归(AR)视觉生成已成为图像和多模态合成的强大范式,得益于其可扩展性和通用性。然而,现有AR图像生成因解码过程中需要缓存所有先前生成的视觉标记而遭受严重的内存瓶颈,导致高存储需求和低吞吐量。本文提出LineAR,一种新颖的、无需训练的自回归图像生成渐进式键值(KV)缓存压缩流水线。通过充分利用视觉注意力的内在特性,LineAR以二维视角在线级别管理缓存,在逐步驱逐对后续行生成无害的较少信息标记的同时保留视觉依赖区域,由行间注意力引导。LineAR通过仅利用少量缓存行实现高效的自回归图像生成,在保持甚至提升生成质量的同时实现内存节省和吞吐量加速。在六个自回归图像生成模型上的广泛实验,包括类条件生成和文本到图像生成,验证了其有效性和通用性。LineAR在LlamaGen-XL上将ImageNet FID从2.77提升至2.68,在COCO FID上从23.85提升至22.86,同时仅保留1/6的KV缓存。它还在仅保留1/8 KV缓存的情况下将Lumina-mGPT-768的DPG提升了。此外,LineAR实现了显著的内存和吞吐量增益,包括在LlamaGen-XL上最高67.61%的内存减少和7.57倍加速,以及在Janus-Pro-7B上39.66%的内存减少和5.62倍加速。
引用
@article{arxiv.2512.04857,
title = {Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens},
author = {Ziran Qin and Youru Lv and Mingbao Lin and Zeren Zhang and Chanfan Gan and Tieyuan Chen and Weiyao Lin},
journal= {arXiv preprint arXiv:2512.04857},
year = {2025}
}