VPG:用于自回归图像和视频生成的视觉前缀引导
计算机视觉与模式识别
2026-05-29 v1
摘要
自回归图像和视频生成器在训练时使用师辅历史,但在推理时必须从自身生成的前缀进行采样,使其易受曝光偏差和前缀漂移的影响。现有方法要么修改训练,要么应用采样时的引导,主要针对外部语义条件(如类别标签或文本提示),而非检验下一步预测是否为生成前缀提供强大的后验支持。我们提出视觉前缀引导 (VPG),一种用于自回归图像和视频生成的训练-free 推理时引导方法。VPG 通过对比模型在生成前缀下的输出与在受损前缀下的输出,改进下一步预测,然后对 logits 进行外推,朝向能够强化生成前缀后验支持的候选选项。 在 VAR 的类别条件图像生成、Infinity 的文本到图像生成以及 InfinityStar 的文本到视频生成任务中,VPG 在不重新训练基础模型的前提下提升了生成质量,平均降低 VAR 的 FID 0.36,并在图像和视频生成基准测试中取得更好的表现。
引用
@article{arxiv.2605.30317,
title = {VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation},
author = {Xinyao Liao and Qiyuan He and Yicong Li and Jiayin Zhu and Xiaoye Qu and Wei Wei and Angela Yao},
journal= {arXiv preprint arXiv:2605.30317},
year = {2026}
}