Hawk:利用空间上下文加速自回归文本到图像生成
计算机视觉与模式识别
2025-10-30 v1 机器学习
摘要
自回归(AR)图像生成模型能够产生高保真图像,但因其固有的逐标记解码过程,往往存在推理速度慢的问题。采用轻量级草稿模型近似较大AR模型输出的预测性解码技术,在不牺牲质量的情况下显示出加速文本生成的前景。然而,其在图像生成中的应用仍主要未得到探索。挑战源于显著更大的采样空间,使草稿模型和目标模型输出之间的对齐变得复杂,同时不充分利用图像固有的二维空间结构,从而限制了对局部依赖关系的建模。为克服这些挑战,我们引入Hawk,一种利用图像空间结构引导预测模型 toward 更准确和更高效预测的新方法。在多个文本到图像基准测试中,我们的实验结果表明,Hawk相较于标准AR模型实现了1.71倍的加速,同时保持了图像的保真度和多样性。
引用
@article{arxiv.2510.25739,
title = {Hawk: Leveraging Spatial Context for Faster Autoregressive Text-to-Image Generation},
author = {Zhi-Kai Chen and Jun-Peng Jiang and Han-Jia Ye and De-Chuan Zhan},
journal= {arXiv preprint arXiv:2510.25739},
year = {2025}
}