中文

VideoCanvas:基于上下文条件的统一视频完成框架

计算机视觉与模式识别 2026-05-28 v2

摘要

现有的可控视频生成方法通常针对刚性、任务特定的设置进行设计,如基于第一帧图像的视频生成、图像拼贴或插值,将时空控制视为一组孤立的问题。我们形式化了一个统一任务——任意时空视频完成,该模型可从用户指定的任意空间位置和时间戳处放置的补丁生成连贯视频。然而,在现代潜在视频扩散模型中实现此统一框架则颇具挑战性:因果视频VAE将多个帧压缩到单个潜在槽,导致帧级条件控制根本不可行;直接将稀疏填充、零填充的视频输入喂入VAE会导致严重的分布外伪影。为此,我们提出VideoCanvas,一个简单而有效的框架,采用“上下文条件”范式来实现任意时空完成,无需修改或重新训练VAE。我们的核心思想是一种混合条件策略,解耦空间和时间控制:在空间上,我们编码零填充的完整帧画布以图像模式保持VAE输入分布内;在时间上,我们采用Temporal RoPE Interpolation为每个条件分配连续的分数索引,以实现精确的帧级对齐。为评估此能力,我们开发了VideoCanvasBench——首个针对任意时空视频完成的基准,涵盖场景内保真度和场景间创造力。大量实验表明,VideoCanvas在单一统一框架下,实现了在多样化视频生成任务上的最先进性能。

关键词

引用

@article{arxiv.2510.08555,
  title  = {VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning},
  author = {Minghong Cai and Qiulin Wang and Zongli Ye and Wenze Liu and Quande Liu and Weicai Ye and Xintao Wang and Pengfei Wan and Kun Gai and Xiangyu Yue},
  journal= {arXiv preprint arXiv:2510.08555},
  year   = {2026}
}

备注

Project page: https://onevfall.github.io/project_page/videocanvas