StreamGVE:通过少步流式视频生成实现无需训练的视频编辑
计算机视觉与模式识别
2026-05-21 v1
摘要
虽然现有的视频编辑方法通常是可行的,但它们往往需要许多昂贵的迭代,仍然难以提供高质量且令人满意的编辑结果。我们将这种限制归因于常见的数据到数据范式,而该范式不太适合现代生成模型。为此,我们从噪声到数据的视角重新审视视频编辑,提出基于流式视频生成的视频编辑 (StreamGVE),在保持少量采样步骤的同时无缝注入源视频条件。基于预训练的流式生成模型构建,StreamGVE 引入双分支快速采样,配合自注意力桥接和交叉注意力 grounding/boosting,以满足采样和条件要求。我们进一步提出了源导向的指导,以提高目标生成质量,并提出了视觉提示策略以增强编辑的灵活性和实用性。该方法有效、稳健且具有广泛适用性。在多样化的视频编辑任务上的大量实验表明,StreamGVE 在各种设置下都 consistently 优于现有方法,即使在最少时间成本的少量步骤设置下也能做到这一点。
引用
@article{arxiv.2605.21466,
title = {StreamGVE: Training-Free Video Editing via Few-Step Streaming Video Generation},
author = {Guanlong Jiao and Chenyangguang Zhang and Jia Jun Cheng Xian and Zewei Zhang and Renjie Liao},
journal= {arXiv preprint arXiv:2605.21466},
year = {2026}
}
备注
Project Page: https://dsl-lab.github.io/StreamGVE/