中文

PanoLlama:用于生成无限连贯全景图的下一词预测LLM

计算机视觉与模式识别 2025-08-04 v3

摘要

全景图像生成(PIG)旨在创建任意长度的连贯图像。大多数现有方法属于联合扩散范式,但其复杂且规范性的裁剪连接设计常常限制其实现多层次连贯性的能力。通过将这一挑战分解为其核心组件,我们发现其自然地与下一词预测相吻合,从而我们采用自回归(AR)范式来进行PIG建模。然而,现有的视觉自回归(VAR)模型仅限于固定大小生成,缺乏生成全景图像的能力。本文提出PanoLlama,一个实现无限连贯全景图生成的新型框架。我们的方法开发了一种无需训练的策略,利用令牌重定向来克服现有VAR模型的大小限制,从而实现水平和垂直方向上的下一裁剪预测。这一方法在刷新PIG管道的同时,实现了在连贯性(47.50%)、保真度(28.16%)和美学(15%)方面的SOTA性能。此外,PanoLlama支持其他PIG方法无法实现的应用,包括无掩码布局控制、多尺度和多引导合成。为便于标准化评估,我们还建立了一个包含1000个提示、覆盖100多个主题的数据集,为PIG研究提供了新的测试基准。代码可在https://github.com/0606zt/PanoLlama获取。

关键词

引用

@article{arxiv.2411.15867,
  title  = {PanoLlama: Generating Endless and Coherent Panoramas with Next-Token-Prediction LLMs},
  author = {Teng Zhou and Xiaoyu Zhang and Yongchuan Tang},
  journal= {arXiv preprint arXiv:2411.15867},
  year   = {2025}
}