中文

ARSS:控制解码器单向自回归视觉生成用于单视图视角合成

计算机视觉与模式识别 2025-12-09 v2

摘要

扩散模型在世界建模任务中取得了令人印象深刻的结果,包括从稀疏输入生成新视角。然而,大多数现有的基于扩散的 novel view synthesis 方法是通过迭代去噪过程联合生成目标视图,这使得不那么直观地在相机轨迹上施加严格的因果结构。相比之下,自回归(AR)模型以因果方式生成每个标记,基于所有先前生成的标记。在本文中,我们引入 ARSS,一个新框架,利用基于 GPT 的解码器-only AR 模型从单张图像生成 novel view,条件受预定义的相机轨迹。我们采用即插即用的视频标记化器将连续图像序列映射到离散标记,并提出一种相机编码器,将相机轨迹转换为 3D 位置引导。然后为了在保持自回归结构的同时提升生成质量,我们提出一种自回归变换器模块,该模块随机排列空间标记的顺序,但保持它们的时序顺序。在公共数据集上的定性和定量实验表明,我们的方法在整体性能上与基于扩散模型的 state-of-the-art view synthesis 方法相当。项目页面:https://wbteng9526.github.io/arss/。

关键词

引用

@article{arxiv.2509.23008,
  title  = {ARSS: Taming Decoder-only Autoregressive Visual Generation for View Synthesis From Single View},
  author = {Wenbin Teng and Gonglin Chen and Haiwei Chen and Yajie Zhao},
  journal= {arXiv preprint arXiv:2509.23008},
  year   = {2025}
}