中文

DreaMontage:基于任意帧引导的单镜头视频生成

计算机视觉与模式识别 2025-12-29 v2

摘要

「单镜头」技术代表了一种独特且精妙的美学。然而,其实际实现常常受到高昂的成本和复杂的现实约束的制约。尽管新兴的视频生成模型提供了虚拟替代方案,但现有方法通常依赖于朴素的片段拼接,常常无法维持视觉平滑性和时间连贯性。本文提出 DreaMontage,一个综合性的框架,用于任意帧引导的生成,能够从多样化的用户提供输入中合成连贯、富有表现力且持续时长的单镜头视频。为实现此目标,我们通过三个主要维度来解决挑战。(i) 我们将轻量级中间条件制导机制集成到 DiT 架构中。通过采用自适应调谐策略有效地利用基础训练数据,我们 unlocked 了强大的任意帧控制能力。(ii) 为了提高视觉保真度和电影化表现力,我们构建了高质量数据集并实施了视觉表达 SFT 阶段。针对主题运动合理性和转换平滑性等关键问题,我们应用了量身定制的 DPO方案,显著提高了生成内容的成功率和可用性。(iii) 为了便于生产延长序列,我们设计了在内存效率方面运行的分段自回归 (SAR) 推理策略。广泛的实验表明,我们的方法实现了视觉引人注目且连贯的单镜头效果,同时保持了计算效率,使用户能够将碎片化视觉材料转化为生动、连贯的单镜头电影体验。

关键词

引用

@article{arxiv.2512.21252,
  title  = {DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation},
  author = {Jiawei Liu and Junqiao Li and Jiangfan Deng and Gen Li and Siyu Zhou and Zetao Fang and Shanshan Lao and Zengde Deng and Jianing Zhu and Tingting Ma and Jiayi Li and Yunqiu Wang and Qian He and Xinglong Wu},
  journal= {arXiv preprint arXiv:2512.21252},
  year   = {2025}
}

备注

Project Page: https://dreamontage.github.io/DreaMontage/