中文

LIVE:利用图像操纵先验进行指令导视视频编辑

计算机视觉与模式识别 2026-04-21 v1

摘要

视频编辑旨在根据用户意图修改输入视频。最近,端到端训练方法受到广泛关注,通过视频生成或编辑模型构建配对视频编辑数据。然而,与图像编辑相比,视频数据的高标注成本严重限制了基于视频生成模型或人工标注的视频编辑数据集的规模、质量和任务多样性。为弥合这一差距,我们提出了LIVE框架,利用大规模高质量图像编辑数据与视频数据集联合训练,以提升编辑能力。为缓解静态图像与动态视频之间的领域差异,我们引入帧级 token 噪声策略,将特定帧的潜在特征视为推理 token,利用大型预训练视频生成模型创建合理的时序转换。此外,我们清理公共数据集并构建自动化数据管道,采用两阶段训练策略来逐步培养视频编辑能力。我们还构建了全面的评估基准,包含60多个挑现实中常见但稀缺于现有视频数据集的挑战性任务。广泛的比较和消融实验表明,我们的方法实现了最先进的性能。该源代码将公开提供。

关键词

引用

@article{arxiv.2604.17021,
  title  = {LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing},
  author = {Weicheng Wang and Zhicheng Zhang and Zhongqi Zhang and Juncheng Zhou and Yongjie Zhu and Wenyu Qin and Meng Wang and Pengfei Wan and Jufeng Yang},
  journal= {arXiv preprint arXiv:2604.17021},
  year   = {2026}
}