中文

Hawk:利用空间上下文加速自回归文本到图像生成

计算机视觉与模式识别 2025-10-30 v1 机器学习

摘要

自回归(AR)图像生成模型能够产生高保真图像,但因其固有的逐标记解码过程,往往存在推理速度慢的问题。采用轻量级草稿模型近似较大AR模型输出的预测性解码技术,在不牺牲质量的情况下显示出加速文本生成的前景。然而,其在图像生成中的应用仍主要未得到探索。挑战源于显著更大的采样空间,使草稿模型和目标模型输出之间的对齐变得复杂,同时不充分利用图像固有的二维空间结构,从而限制了对局部依赖关系的建模。为克服这些挑战,我们引入Hawk,一种利用图像空间结构引导预测模型 toward 更准确和更高效预测的新方法。在多个文本到图像基准测试中,我们的实验结果表明,Hawk相较于标准AR模型实现了1.71倍的加速,同时保持了图像的保真度和多样性。

关键词

引用

@article{arxiv.2510.25739,
  title  = {Hawk: Leveraging Spatial Context for Faster Autoregressive Text-to-Image Generation},
  author = {Zhi-Kai Chen and Jun-Peng Jiang and Han-Jia Ye and De-Chuan Zhan},
  journal= {arXiv preprint arXiv:2510.25739},
  year   = {2025}
}