中文

序列到序列生成式神经渲染的扩展

计算机视觉与模式识别 2026-05-05 v3

摘要

我们提出了 Kaleido,一套为实现真实感统一物体和场景级神经渲染而设计的生成模型。Kaleido 的核心理念是将 3D 视为视频的专用子域,纯粹表述为序列到序列图像合成任务。通过对序列到序列生成式神经渲染的系统性扩展研究,我们引入了关键架构创新,使我们的模型能够:i)在无需显式 3D 表示的情况下执行生成式视图合成;ii)通过掩码自回归框架在任意数量的参考视图条件下生成任意数量的 6 自由度目标视图;iii)在单一解码器-only rectified flow transformer 中无缝统一 3D 和视频建模。在这一统一框架中,Kaleido 利用大规模视频数据进行预训练,这显著提高了空间一致性,减少了对稀缺带相机标定 3D 数据集的依赖——且无需任何架构修改。Kaleido 在多组视图合成基准测试中设下新的状态记录。其零样本性能在少量视图设置下显著优于其他生成方法,在多视图设置下甚至首次匹配到 per-scene optimization 方法的质量。

关键词

引用

@article{arxiv.2510.04236,
  title  = {Scaling Sequence-to-Sequence Generative Neural Rendering},
  author = {Shikun Liu and Kam Woh Ng and Wonbong Jang and Jiadong Guo and Junlin Han and Haozhe Liu and Yiannis Douratsos and Juan C. Pérez and Zijian Zhou and Chi Phung and Tao Xiang and Juan-Manuel Pérez-Rúa},
  journal= {arXiv preprint arXiv:2510.04236},
  year   = {2026}
}

备注

Published at ICLR 2026. Project Page: https://shikun.io/projects/kaleido