生成视图拼接
计算机视觉与模式识别
2026-04-13 v3 机器学习
摘要
自回归视频扩散模型能够进行稳定且与历史一致的长期滚动,但无法利用来自未来的条件指导当前生成。这一限制在具有预定义摄像机轨迹的相机引导视频生成中导致场景与生成碰撞,随后自回归迅速崩溃。为此,我们提出生成视图拼接(GVS),对整个序列进行并行采样,以确保生成场景忠实于预定义摄像机轨迹的每个部分。我们的主要贡献是扩展先前用于机器人规划的扩散拼接工作的采样算法。虽然此类拼接方法通常需要专门训练的模型,但 GVS 可与任何基于扩散强制训练的现成视频模型兼容,而扩散强制是一种流行的序列扩散框架,我们证明其已经提供了必要的拼接便利。我们 then 引入 Omni Guidance 技术,通过对过去和未来进行条件来增强拼接中的时序一致性,并实现我们提出的闭环机制,以交付长程连贯性。总体而言,GVS 实现了稳定、无碰撞、帧与帧一致且可为各种预定义摄像机路径闭合环路的相机引导视频生成,包括奥斯卡·罗德斯维尔德的不可能楼梯。结果最佳以视频形式呈现,访问 https://andrewsonga.github.io/gvs。
引用
@article{arxiv.2510.24718,
title = {Generative View Stitching},
author = {Chonghyuk Song and Michal Stary and Boyuan Chen and George Kopanas and Vincent Sitzmann},
journal= {arXiv preprint arXiv:2510.24718},
year = {2026}
}
备注
Published at ICLR 2026. Camera-ready Submission. Project website: https://andrewsonga.github.io/gvs