基于视觉全景提示的自回归图像生成
计算机视觉与模式识别
2025-03-13 v3
摘要
在自回归(AR)图像生成中,基于 LLM “下一 token 预测”范式的模型通过减少归纳偏置,展现出了与扩散模型相当的性能。然而,将 LLM 直接应用于复杂图像生成可能难以重建图像的结构与细节,从而影响生成的准确性与稳定性。此外,AR 模型中的“下一 token 预测”范式与人类视觉感知中的上下文扫描和逻辑推理过程不符,限制了有效的图像生成。提示工程作为引导 LLM 的关键技术,利用特定设计的提示来提升模型在复杂自然语言处理(NLP)任务上的表现,在保持上下文连贯性与逻辑一致性的同时增强了生成的准确性与稳定性,类似于人类的推理过程。受 NLP 领域提示工程的启发,我们提出了视觉全景提示来增强自回归图像生成。具体而言,我们为 AR 图像生成设计了专门的图像相关 VF 提示,以模拟人类图像创作的过程。该方法通过让模型在生成图像前先感知整体分布信息来增强上下文逻辑能力,并通过增加推理步数来提高生成稳定性。与未使用 VF 提示的 AR 方法相比,我们的方法展现出优异的性能,实现了约 20% 的提升。
引用
@article{arxiv.2502.16965,
title = {Autoregressive Image Generation with Vision Full-view Prompt},
author = {Miaomiao Cai and Guanjie Wang and Wei Li and Zhijun Tu and Hanting Chen and Shaohui Lin and Jie Hu},
journal= {arXiv preprint arXiv:2502.16965},
year = {2025}
}