中文

DCARL:用于长轨迹视频生成的分割- conquering自回归框架

计算机视觉与模式识别 2026-03-27 v1

摘要

长轨迹视频生成是世界建模中的关键且具有挑战性的任务,主要由于现有视频扩散模型 (VDMs) 的可扩展性有限。自回归模型虽然提供无限 rollout,却 suffer from 视觉漂移和控制性差。为此,我们提出 DCARL,一种 novel 的分割- conquering 自回归框架,有效结合了分割- conquering scheme 的结构稳定性与 VDMs 的高保真生成能力。我们的 method 首先采用专门的 Keyframe Generator 进行训练,无需时间压缩,以建立长范围、全球一致的结构锚点。随后,Interpolation Generator 以自回归方式合成密集帧,采用重叠段落,利用 keyframes 获得全局上下文,以及单个干净的前一帧获得局部一致性。基于大规模互联网长轨迹视频数据集训练,我们的方法在视觉质量(更低的 FID 和 FVD)和摄像机遵循性(更低的 ATE 和 ARE)方面均优于最先进的自回归和分割- conquering baseline,展示了在最长 32 秒长度下长轨迹视频的稳定高保真生成。

关键词

引用

@article{arxiv.2603.24835,
  title  = {DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation},
  author = {Junyi Ouyang and Wenbin Teng and Gonglin Chen and Yajie Zhao and Haiwei Chen},
  journal= {arXiv preprint arXiv:2603.24835},
  year   = {2026}
}

备注

29 pages, 11 figures. Project page: https://junyiouy.github.io/projects/dcarl