中文

VACE:视频内容创建与编辑的一体化框架

计算机视觉与模式识别 2025-03-12 v2

摘要

扩散Transformer在生成高质量图像和视频方面已显示出强大的能力和可扩展性。进一步追求生成和编辑任务的统一,已在图像内容创建领域取得显著进展。然而,由于在时空动态方面的一致性要求,实现视频合成的统一方法仍具有挑战性。我们引入VACE,实现了在用于Creation和Editing的All-in-one框架中完成Video任务。这些任务包括reference-to-video generation、video-to-video editing和masked video-to-video editing。具体而言,我们通过组织视频任务输入(如编辑、参考和遮罩)到称为视频条件单元(VCU)的统一接口中,有效集成了各种任务的要求。此外,通过利用Context Adapter结构,我们使用时空维度的形式化表示将不同的任务概念注入模型,使其能够灵活处理任意视频合成任务。广泛的实验表明,VACE的统一模型在各种子任务上性能与任务特定模型相当。同时,它通过多样化的任务组合实现了多样化的应用。项目页面:https://ali-vilab.github.io/VACE-Page/。

关键词

引用

@article{arxiv.2503.07598,
  title  = {VACE: All-in-One Video Creation and Editing},
  author = {Zeyinzi Jiang and Zhen Han and Chaojie Mao and Jingfeng Zhang and Yulin Pan and Yu Liu},
  journal= {arXiv preprint arXiv:2503.07598},
  year   = {2025}
}

备注

Project page: https://ali-vilab.github.io/VACE-Page/