中文

VIA:面向全局与局部视频编辑的统一时空视频自适应框架

计算机视觉与模式识别 2025-03-28 v3 人工智能 多媒体

摘要

视频编辑是数字媒体的基本支柱,应用涵盖娱乐、教育和专业交流。然而,先前的方法常常忽略了对全局和局部上下文的全面理解,导致在时空维度上出现不准确和不一致的编辑,尤其是对于长视频。在本文中,我们介绍了VIA,一个用于全局和局部视频编辑的统一时空视频自适应框架,推动了持续编辑分钟级长视频的极限。首先,为确保单个帧内的局部一致性,我们设计了测试时编辑自适应,以适配预训练的图像编辑模型,提高潜在编辑方向与文本指令之间的一致性,并适配掩码潜在变量以实现精确的局部控制。此外,为保持视频序列的全局一致性,我们引入了时空自适应,该自适应递归地在关键帧中收集一致的注意力变量,并策略性地将其应用于整个序列以实现编辑效果。大量实验表明,与基线方法相比,我们的VIA方法产生的编辑更忠实于源视频,在时空上下文中更连贯,并且在局部控制上更精确。更重要的是,我们展示了VIA可以在几分钟内实现一致的长视频编辑,为长视频序列上的高级视频编辑任务解锁了潜力。

关键词

引用

@article{arxiv.2406.12831,
  title  = {VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing},
  author = {Jing Gu and Yuwei Fang and Ivan Skorokhodov and Peter Wonka and Xinya Du and Sergey Tulyakov and Xin Eric Wang},
  journal= {arXiv preprint arXiv:2406.12831},
  year   = {2025}
}

备注

18 pages, 16 figures