DCARL:用于长轨迹视频生成的分割- conquering自回归框架
计算机视觉与模式识别
2026-03-27 v1
摘要
长轨迹视频生成是世界建模中的关键且具有挑战性的任务,主要由于现有视频扩散模型 (VDMs) 的可扩展性有限。自回归模型虽然提供无限 rollout,却 suffer from 视觉漂移和控制性差。为此,我们提出 DCARL,一种 novel 的分割- conquering 自回归框架,有效结合了分割- conquering scheme 的结构稳定性与 VDMs 的高保真生成能力。我们的 method 首先采用专门的 Keyframe Generator 进行训练,无需时间压缩,以建立长范围、全球一致的结构锚点。随后,Interpolation Generator 以自回归方式合成密集帧,采用重叠段落,利用 keyframes 获得全局上下文,以及单个干净的前一帧获得局部一致性。基于大规模互联网长轨迹视频数据集训练,我们的方法在视觉质量(更低的 FID 和 FVD)和摄像机遵循性(更低的 ATE 和 ARE)方面均优于最先进的自回归和分割- conquering baseline,展示了在最长 32 秒长度下长轨迹视频的稳定高保真生成。
引用
@article{arxiv.2603.24835,
title = {DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation},
author = {Junyi Ouyang and Wenbin Teng and Gonglin Chen and Yajie Zhao and Haiwei Chen},
journal= {arXiv preprint arXiv:2603.24835},
year = {2026}
}
备注
29 pages, 11 figures. Project page: https://junyiouy.github.io/projects/dcarl