中文

基于扩散Transformer的视频OutDreamer

计算机视觉与模式识别 2025-06-30 v1

摘要

视频outpainting是一项具有挑战性的任务,需要生成超出原始输入视频边界的新视频内容,要求保持时空一致性。许多最新方法利用带有U-Net骨干网络的潜在扩散模型,但仍难以在生成内容的质量和适应性方面实现卓越表现。扩散Transformer(DiT)因其卓越性能而日益备受青睐。我们引入OutDreamer,一个基于DiT的视频outpainting框架,包含两个主要组件:一个高效的视频控制分支和一个条件outpainting分支。高效的视频控制分支有效提取被遮蔽的视频信息,而条件outpainting分支则基于这些提取的条件生成缺失内容。此外,我们提出一种基于mask的自注意力层,动态整合给定的mask信息,进一步增强模型对outpainting任务的适应性。我们还引入潜在对齐损失,以维持帧内及帧间的整体一致性。对于长视频outpainting,我们采用跨视频剪辑细化器来迭代生成缺失内容,确保视频剪辑之间的时序一致性。广泛的评估表明,零样本OutDreamer在广为人知的基准测试上超越了最新的零样本方法。

关键词

引用

@article{arxiv.2506.22298,
  title  = {OutDreamer: Video Outpainting with a Diffusion Transformer},
  author = {Linhao Zhong and Fan Li and Yi Huang and Jianzhuang Liu and Renjing Pei and Fenglong Song},
  journal= {arXiv preprint arXiv:2506.22298},
  year   = {2025}
}