中文

并非所有 token 在引导方面都相等:提高视觉自回归模型中的引导方式

计算机视觉与模式识别 2025-10-02 v2 人工智能

摘要

基于下一尺度预测的自回归 (AR) 模型正快速成为图像生成的强大工具,但面临一个关键弱点:由于分辨率比例的渐进式缩放,导致跨时间步中 patch 之间信息不一致。这些不一致将稀释引导信号,使其偏离条件信息,留下模糊、不忠实的特征。我们通过信息 grounding 引导 (IGG) 提出了一种新型机制,通过注意力将引导锚定到语义上重要的区域。通过在采样期间适应性地强化信息丰富的 patch,IGG 确保引导与内容紧密对齐。在 class 条件和 text-to-image 生成任务中,IGG 交付更锐利、更连贯且语义更准确的图像,为 AR 方法树立了新的基准。

关键词

引用

@article{arxiv.2509.23876,
  title  = {Not All Tokens are Guided Equal: Improving Guidance in Visual Autoregressive Models},
  author = {Ky Dan Nguyen and Hoang Lam Tran and Anh-Dung Dinh and Daochang Liu and Weidong Cai and Xiuying Wang and Chang Xu},
  journal= {arXiv preprint arXiv:2509.23876},
  year   = {2025}
}

备注

17 pages, 7 figures; added shared first authorship statement